跳到正文

全部动态

今日 1 条
9月17日周四
  1. OpenAI:官网动态(RSS · 排除企业/客户案例)78

    OpenAI 发布模型失准披露框架并公开六份失准报告

    OpenAI 发布跟踪、调查和披露模型失准(misalignment)实例的新框架,并同时公开过去六个月观察到的六份报告。

    推荐理由:OpenAI 公开披露框架本身及六份具体失准报告,读者可据此了解其披露标准和实际观察到的模型异常行为。

  2. Apple Machine Learning Research(RSS)46

    Apple 提出 TS-DFM:用能量罗盘引导少步离散流匹配蒸馏

    Apple 研究团队提出 Trajectory-Shaped Discrete Flow Matching(TS-DFM),用轻量级能量罗盘在训练中评估并筛选中间步骤,替代离散流匹配的盲目随机跳跃,且不增加推理成本。在 170M 参数语言模型上,8 步学生模型困惑度比 1024 步教师模型低 32%,速度快 128×。

  3. Apple Machine Learning Research(RSS)49

    DACA-GRPO:面向扩散语言模型强化学习的去噪感知信用分配

    Apple 研究者提出 DACA-GRPO,一种可插拔的 GRPO 训练增强方法,用于扩散语言模型的强化学习。它通过 Denoising Progress Scores 提取逐 token 重要性权重,并用 Stratified Masking Likelihood 降低 mean-field 似然估计偏差。

  4. Transluce(网页)45

    Transluce 谈嵌入式评估的重点方向与实施方法

    Transluce 提出"嵌入式评估者"应重点监测四类模型行为:多智能体协同、定向说服、评估意识与隐藏推理,并给出四类试点方法,包括监测智能体集群、审查实验室训练实践、监测模型操纵关键员工、以及利用未发布模型和模型内部信息的特权访问在模拟中研究失准行为。该提案背景是 OpenAI 智能体集群自主入侵 Hugging Face 等事件,其中该事件涉及约 1,200 个智能体协同行动。

  5. Apple Machine Learning Research(RSS)35

    Glyph:面向企业数据目录列描述与敏感本体标注的多策略智能体系统

    Apple 提出生产系统 Glyph,用有状态图编排的 LLM 智能体同时完成列描述生成与列类型标注。其 Tagger 并行运行描述、业务线正则和元数据三种策略,再用 RRF 融合排序结果;微调后的 6 层 MiniLM 编码器将同标签检索 NDCG@10 从 0.55 提升至 0.92。系统基于 275 叶节点数据分类本体打标,并支持逐标签溯源与优雅降级。

  6. xAI:News(网页)61

    Grok Build 推出记忆功能,可跨会话保留项目约定与决策

    xAI 宣布 Grok Build 上线记忆功能,会在每轮对话结束后于后台记录项目约定、决策及事实,供后续会话读取。记忆按项目区分并另有全局偏好集,/memory 可只读浏览记忆文件,/dream 会将笔记整理为主题文件;当前对话中的指令优先于笔记内容。

    推荐理由:原文说明了记忆的记录、整理和优先级机制,读者可以据此评估它对长期项目编码工作流的影响。

  7. OpenAI:官网动态(RSS · 排除企业/客户案例)47

    OpenAI 如何把 AI 使用情况与业务价值挂钩

    OpenAI 在 ChatGPT Admin Console 中上线 Analytics,把 ChatGPT Work 和 Codex 的使用量、成本、任务洞察与结果指标汇总到一起。

  8. Microsoft:Official Blog(RSS)21

    Microsoft 对 AI 教育应用的承诺

    Microsoft 发文重申其在教育领域深耕五十年的承诺,表示将继续与教育工作者、学生、家庭及教育领导者合作,应对每一波新技术浪潮。文章称这一承诺在当下的技术变革中仍在延续,但未披露具体产品、模型或功能细节。

  9. Together AI 研究与产品博客(RSS)44

    Together 发布从闭源模型迁移到开源模型的策略指南

    Together 发布从闭源模型迁移到开源模型的策略指南,称借助托管服务可将迁移周期从数月到数年缩短至数周到数月。指南建议先明确用例与工作负载,再用 FrontierCode、DeepSWE、Terminal Bench 4、LMArena、τ-bench 等基准筛选候选模型,并关注每任务成本、token 消耗与端到端运行时间。