跳到正文

#推理

今日 2 条
9月4日周五
  1. Greg Brockman72

    Greg Brockman 转发 @arcprize 的评测称 OpenAI 的 GPT-6 Astra 在 ARC-AGI-3 上取得 SOTA,他称该基准已饱和。Astra 标准 harness 得分 63%,经新的 Provider Adapter harness 达 99%,在 96% 的 ARC-AGI-3 关卡上超越人类表现;排行榜图还显示更高推理层级通常成本更低,因为 Astra 用更少动作通关,减少模型调用和 token 数。

    推荐理由:转发 ARC Prize 对 GPT-6 Astra 的评测数据,标准与 Provider Adapter 两种 harness 分差大,可据此了解 harness 对得分的影响。

  2. Sherwin Wu66

    Sherwin Wu 表示自己曾觉得 ARC-AGI-3 很难,如今该基准已被 Astra 饱和。引用 François Chollet 的话称,ARC 3 发布时他预计前沿模型约一年才能饱和,实际只用了 6 个月,约为预期的 2 倍速度,新一代模型的能力将挑战人们基于旧模型形成的 AI 观点。

    推荐理由:结合 Arc Prize 负责人的预估与半年即饱和的结果,读者可以借此对照自己对前沿模型进展速度的预期。

  3. Noam Brown66

    OpenAI 发布仓库 PrimeGaps186(https://github.com/openai/PrimeGaps186),其中 GPT-6-Astra 的 Lean 形式化证明了存在无穷多对间隔不超过 186 的相邻素数。Noam Brown 表示在 GPT-6 Astra 的所有用途中最期待科学发现,称 OpenAI 尚未在数学和科学上把该模型推向极限。仓库说明指出 Lean 结果仍依赖三个明确输入公理,被引用的数学估计和数值计算尚未转化为这些输入的 Lean 证明。

  4. Hacker News 热门(buzzing.cc 中文翻译)78

    IFM 发布 K2 Horizon 六款开源模型,覆盖 0.9B 到 375B-A23B 并开放完整训练生命周期

    IFM 发布 K2 Horizon 模型系列,共六个模型:375B-A23B、36B-A4B、32B、7B、3.7B 和 0.9B,均以 Apache 2.0 开源,其中 0.9B、3.7B 和 7B 宣称在其规模上达到 SOTA,36B-A4B 采用新提出的稀疏注意力架构 MoVA。

    推荐理由:原文在发布模型之外还放出从预训练到智能体后训练的全流程产物,研究者可以据此复现和改造整套训练方法。

  5. TechCrunch:AI(RSS)81

    OpenAI 发布新模型 Astra,主打计算机与浏览器操作但因 opaque recurrence 引发争议

    OpenAI 发布最新模型 Astra,称其为迄今最强大模型,主打计算机和浏览器操作,先面向 Daybreak 网络安全计划客户开放,随后一周内覆盖 Pro、Plus、Enterprise、Business 付费账户及 API。

    推荐理由:原文梳理了 Astra 的能力主张、发布节奏,以及 opaque recurrence 引发的可监控性争议,信息较为完整。

9月3日周四
  1. Thomas Wolf42

    Thomas Wolf 引用 @jdlichtman 的消息:其同事 Youness Lamzouri 产出了对 Claude 关于超过 2/3 zeta 零点论证的更简单的人类版证明消化。论文摘要称给出概念上更简短的无条件证明,证明超过 67.25% 的非平凡零点简单且位于临界线上,至少 83.62% 非平凡零点互不相同;原证明由 Anthropic 内部研究版 Claude 产出并经 Alpöge 和 Furman 验证,新证明用 Hilbert 空间不等式替代矩阵框架。作者评论 great mathematicians still lead on taste。