跳到正文

#推理

今日 0 条
10月7日周三
10月3日周六
10月2日周五
  1. MIT Technology Review · AI38

    别被迷惑:LLM 并不会真正推理

    前 Google DeepMind 研究员指出,LLM 的思维链并非真正的推理机制,它仍由同一个 next-token 预测过程迭代生成,只是延长了作答前的计算。文章认为当前模型存在三大缺陷:没有显式、持久、可检查的认知状态,知识与推理在神经网络权重中纠缠不清,且思维链常是事后编造。作者主张借鉴 AlphaGo 的搜索架构,为机器推理引入独立的推理机制。

9月29日周二
  1. Hacker News 热门(buzzing.cc 中文翻译)31

    月球明暗界线悖论:一个用程序解释的视觉错觉

    开发者用程序解释"月球明暗界线悖论":日落时太阳位于地平线以下,月亮被照亮部分本应朝下,但实际常朝上。原因是月亮升高后我们从下方观察,底部露出暗面,月亮越接近满月该现象越明显。作者称 Claude 和 Gemini 在调试中完全无法理解该问题,只会循环论证,认为这显示当前 AI 缺乏推理能力。

9月27日周日
9月26日周六
  1. Hacker News 热门(buzzing.cc 中文翻译)53

    Amit Sahai:AI 时代我们还需要更多的数学家

    数学家 Amit Sahai 在 Terence Tao 博客发文,认为 AI 已在产生超越人类即时理解的新数学思想,人类群体将普遍面临跟不上 AI 的体验。他主张以集体投入和扩充数学研究者规模来理解 AI 突破,并以 AI 提出全新核聚变电站设计的设想说明独立人类专家在重大决策中理解模型与安全依据的必要性。

  2. Anthropic:Research(发表成果 · 网页)70

    Claude 完成 N=4 super Yang-Mills 九圈散射振幅计算,物理学家 Matt von Hippel 撰文回顾挑战过程

    物理学家 Matt von Hippel 发起的挑战达成:Anthropic 的 Liam Fitzpatrick 与 Siddharth Mishra-Sharma 用 Claude Science(harness)让 Claude 直接算出 planar N=4 super Yang-Mills 六粒子振幅九圈结果。

    推荐理由:作者以其曾判定过难的本领域前沿计算为参照,评估了 Claude Science 的实际能力与可推广性,提供了来自领域专家的一手判断。

9月25日周五
9月24日周四
9月23日周三
  1. Hacker News 热门(buzzing.cc 中文翻译)73

    OpenAI 纳维-斯托克斯解法遭质疑:解的是带外力的问题变体

    OpenAI 用内部 LLM 生成纳维-斯托克斯问题的证明后,数学界指出其解法依赖外部力项这一漏洞,偏离了数学家真正关心的无外力版本。上周四三位数学家发文证明去掉外力后爆炸消失,OpenAI 的方法无法扩展到完整问题,但按 Clay Institute 2000 年原始表述的选项 C,其解法成立。

9月22日周二
9月21日周一
9月20日周日
9月19日周六
  1. Epoch AI51

    Epoch AI 宣布 FrontierMath: Open Problems 的又一问题被解决,解法由 Becker、Greger 和 Dominik Peters 在与 GPT-6 Astra 的交互会话中引导得出,该问题最初由 Peters 为该基准提出。GPT-6 Astra 设计出一种满足 core stability 的新投票规则,基于最大化称为 harmonic entropy 的目标函数,该函数综合了多年来人类发展的多种思路。Peters 表示这一新技术或可用于为其他集体决策问题构建公平解。

9月18日周五
  1. Ethan Mollick55

    Ethan Mollick 转发并认同 @ArchieHall 的判断,即 AI 攻克短期超级预测是一个重要且仍被讨论不足的趋势,并引用 @nikostro 发表于 The Economist 的文章,链接为 https://www.economist.com/science-and-technology/2026/09/16/artificial-intelligence-now-beats-some-of-the-best-human-forecasters。文章称 AI 现在已超越部分最优秀的人类预测者;所附图表显示 Metaculus Cup 中 AI 平均成绩相对 Top 30 人类预测者从 2024 年 Q2 起持续上升,至 2026 年 Q3 已接近 1.0(1 为最佳人类成绩)。

  2. The Decoder:AI News(RSS)56

    OpenAI 据报道接近解决 Hodge 猜想,为其第二个千禧年大奖难题

    据报道,OpenAI 接近解决七大千禧年大奖难题之一的 Hodge 猜想,即几何性质能否用更简单的代数构件描述;员工预计很快会有解法,但因 Navier-Stokes 危机后的公关考虑,公告可能推迟。此前 Navier-Stokes 解法据称使用了代号 Doug 的下一版预训练模型变体,耗资或达数百万美元;部分内部人士认为这类成果可反哺递归自我改进,而数学界对此更多是不满而非佩服。

  3. Hacker News 热门(buzzing.cc 中文翻译)68

    Gowers 撰文解释为何没有签署菲尔兹奖得主联名信

    数学家 Timothy Gowers 发文解释自己未签署 25 位菲尔兹奖得主联名信的原因,称自己在解题与概念理解的关系上持光谱观点,不完全认同信中将概念理解置于解题之上的核心论证。他承认 AI 带来危机,但认为更应担心的是新一代数学家培养和资助等社会结构被破坏而非结果无法消化,并披露自己与 OpenAI 有接触但从未收取报酬。

9月17日周四