跳到正文

#推理

今日 2 条
9月20日周日
  1. Rohan Paul72

    Google 发布 ScientistTwo 论文,展示 AI 研究中的递归自我改进:模型先改进人类方法,再以自身发现为新基线继续改进。它以提出想法、实验验证、剔除无效方案并根据评审反馈开启新一轮的循环方式,自主改进了 107 个人类定义 ML 问题中的 86 个;在基于 ICLR、ICML 和 NeurIPS 论文的问题上,报告了 80.4% 的成功率和相对原始人类基线平均 25.2% 的改进。

9月19日周六
  1. HuggingFace Daily Papers(社区热门论文)55

    SAT 自组织智能体团队学会协同推理,超越最强成员

    论文提出自组织智能体团队 SAT,让固定团队的智能体从以往协作中学习角色分工、对话阶段和信息流策略,实现协同计算。仅用 15 道数学和 25 道研究生级知识题学到的策略可原样迁移到未见基准,五个数学与物理基准平均准确率 66.7%,高于最强成员的 48.8% 和完美路由器的 59.0%,在 AIME 2026 上超出该路由器 13.4 分。

  2. Epoch AI51

    Epoch AI 宣布 FrontierMath: Open Problems 的又一问题被解决,解法由 Becker、Greger 和 Dominik Peters 在与 GPT-6 Astra 的交互会话中引导得出,该问题最初由 Peters 为该基准提出。GPT-6 Astra 设计出一种满足 core stability 的新投票规则,基于最大化称为 harmonic entropy 的目标函数,该函数综合了多年来人类发展的多种思路。Peters 表示这一新技术或可用于为其他集体决策问题构建公平解。

9月18日周五
  1. Ethan Mollick55

    Ethan Mollick 转发并认同 @ArchieHall 的判断,即 AI 攻克短期超级预测是一个重要且仍被讨论不足的趋势,并引用 @nikostro 发表于 The Economist 的文章,链接为 https://www.economist.com/science-and-technology/2026/09/16/artificial-intelligence-now-beats-some-of-the-best-human-forecasters。文章称 AI 现在已超越部分最优秀的人类预测者;所附图表显示 Metaculus Cup 中 AI 平均成绩相对 Top 30 人类预测者从 2024 年 Q2 起持续上升,至 2026 年 Q3 已接近 1.0(1 为最佳人类成绩)。

  2. HuggingFace Daily Papers(社区热门论文)85

    DeepSeek-V4.1-Flash 发布:552B MoE 多模态模型主打 KV cache 压缩

    DeepSeek 发布 DeepSeek-V4.1-Flash,一个 552B 参数的多模态 MoE 模型,支持最长 100 万 token 上下文,模型权重已在 Hugging Face 开放。

    推荐理由:论文给出了每 token KV cache 字节数等具体压缩指标,并与上一代模型直接对比,可评估长上下文 Agent 部署成本变化。

  3. 公众号:数字生命卡兹克67

    TypeSafe AI 发布只做高频决策的大模型 Jev,作者实测其分类判断性价比

    TypeSafe AI 推出专注高频决策的大模型 Jev,不做对话和文字生成,只输出判断,速度比传统大模型快20~200倍,成本0.042美元/百万Token且输出Token免费。作者实测预筛任务中Jev准确性第二且更便宜,在并行判断任务上达到最高准确率和最快速度;模型采用RLCD训练方法优化决策校准,可在官网 https://typesafe.ai/ 申请资格,Vercel 已首发接入。

    推荐理由:作者用自己的预筛和并行判断任务实测了Jev与多个模型的准确率、速度和成本,读者可以据此判断这类只做决策的模型适合什么场景。

  4. OpenAI:官网动态(RSS · 排除企业/客户案例)55

    OpenAI 发布 Astra for Law 法律行业基础方案

    OpenAI 发布 Astra for Law,将 GPT-6 Astra 配合法律搜索索引和 Legal 分析写作指令,面向律所和法律科技公司。在 Vals AI Legal Research Bench 私有验证集 200 道美国法律研究题上,最高推理强度下整体正确率 54.0%,比仅用网页搜索的 GPT-6 Astra 的 38.7% 相对提升 40%。

  5. Anthropic:Research(发表成果 · 网页)74

    Anthropic:Claude 四周优化 30 多个开源生物分子模型,平均提速约 4 倍并开源代码

    Anthropic 让 Claude 在不到四周内优化了超过 30 个开源生物分子模型,平均提速约 4 倍、精度损失极小,输出完全一致时也有近 2 倍加速。优化代码全部开源,还推出低内存 Big 模式,可在单张 NVIDIA GPU 节点上对超过 10,000 token 的生物分子系统做准确预测。

    推荐理由:Anthropic 公布了完整提速数据、开源代码和比赛入口,读者可以据此评估 AI 优化科学计算代码的实际水平。

  6. The Decoder:AI News(RSS)56

    OpenAI 据报道接近解决 Hodge 猜想,为其第二个千禧年大奖难题

    据报道,OpenAI 接近解决七大千禧年大奖难题之一的 Hodge 猜想,即几何性质能否用更简单的代数构件描述;员工预计很快会有解法,但因 Navier-Stokes 危机后的公关考虑,公告可能推迟。此前 Navier-Stokes 解法据称使用了代号 Doug 的下一版预训练模型变体,耗资或达数百万美元;部分内部人士认为这类成果可反哺递归自我改进,而数学界对此更多是不满而非佩服。

  7. Hacker News 热门(buzzing.cc 中文翻译)68

    Gowers 撰文解释为何没有签署菲尔兹奖得主联名信

    数学家 Timothy Gowers 发文解释自己未签署 25 位菲尔兹奖得主联名信的原因,称自己在解题与概念理解的关系上持光谱观点,不完全认同信中将概念理解置于解题之上的核心论证。他承认 AI 带来危机,但认为更应担心的是新一代数学家培养和资助等社会结构被破坏而非结果无法消化,并披露自己与 OpenAI 有接触但从未收取报酬。

9月17日周四
  1. Hacker News 热门(buzzing.cc 中文翻译)63

    DeepSeek V4.1 Flash 以 4.65 美元拿下 Enclave AI 黑客基准 11/11,审计揭示 5 条计划外攻击路径

    Enclave AI 的 AI 黑客基准评测中,DeepSeek V4.1 Flash 攻破全部 11 个漏洞目标、4 个修复对照全部守住,接受运行成本仅 4.65 美元。后续审计确认 6 次按计划路径完成,另发现 5 条原评分系统未区分的计划外路径,团队随后关闭这些旁路并对基准加入更严格的路径校验。