Jake Boggan 谈 Barnette 猜想被 AI 证明:24 年心血后的复杂情绪
Jake Boggan 在 Hacker News 评论 openai/math 相关帖子时表示,自己曾为 Barnette 猜想投入 24 年、数千小时,去年夏天还一度以为解决了它,如今该猜想据称已被证明(problem 180)。他说听到消息后有种遥远的悲伤,像得知前女友突然车祸去世,并猜测今晚很多人会有类似的复杂情绪。
Jake Boggan 在 Hacker News 评论 openai/math 相关帖子时表示,自己曾为 Barnette 猜想投入 24 年、数千小时,去年夏天还一度以为解决了它,如今该猜想据称已被证明(problem 180)。他说听到消息后有种遥远的悲伤,像得知前女友突然车祸去世,并猜测今晚很多人会有类似的复杂情绪。
DeepMind 研究者提出「人工共生智能」(Artificial Symbiotic Intelligence),主张 AI 研究的核心挑战是协调由智能体、人和连接系统组成的复杂网络,而非构建孤立的机器智能。
前 Google DeepMind 研究员指出,LLM 的思维链并非真正的推理机制,它仍由同一个 next-token 预测过程迭代生成,只是延长了作答前的计算。文章认为当前模型存在三大缺陷:没有显式、持久、可检查的认知状态,知识与推理在神经网络权重中纠缠不清,且思维链常是事后编造。作者主张借鉴 AlphaGo 的搜索架构,为机器推理引入独立的推理机制。
MIT 研究者 Alex Zhang 在 Latent Space 播客中详解递归语言模型(RLM),其基于 RLM 的 harness 是首个接近解决 ARC-AGI-3 的系统,早于 OpenAI 的 Astra。
开发者用程序解释"月球明暗界线悖论":日落时太阳位于地平线以下,月亮被照亮部分本应朝下,但实际常朝上。原因是月亮升高后我们从下方观察,底部露出暗面,月亮越接近满月该现象越明显。作者称 Claude 和 Gemini 在调试中完全无法理解该问题,只会循环论证,认为这显示当前 AI 缺乏推理能力。
The Verge Decoder 播客专访 Cloudflare CEO Matthew Prince,谈 AI 如何改变互联网商业模式。
数学家 Amit Sahai 在 Terence Tao 博客发文,认为 AI 已在产生超越人类即时理解的新数学思想,人类群体将普遍面临跟不上 AI 的体验。他主张以集体投入和扩充数学研究者规模来理解 AI 突破,并以 AI 提出全新核聚变电站设计的设想说明独立人类专家在重大决策中理解模型与安全依据的必要性。
物理学家 Matt von Hippel 发起的挑战达成:Anthropic 的 Liam Fitzpatrick 与 Siddharth Mishra-Sharma 用 Claude Science(harness)让 Claude 直接算出 planar N=4 super Yang-Mills 六粒子振幅九圈结果。
推荐理由:作者以其曾判定过难的本领域前沿计算为参照,评估了 Claude Science 的实际能力与可推广性,提供了来自领域专家的一手判断。
科学史研究者 benbreen 分享用 GPT-6 Sol、GPT-6 Astra 和 Opus 5.5 解决历史学开放问题的早期结果,包括用 GPT-6 Astra 识别出 Isaac Newton 从法文炼金术文本翻译成拉丁文的一段出处。
Google DeepMind 负责人 Koray Kavukcuoglu 表示 Gemini 4 已处于早期后训练阶段,希望远在年底前发布,工程师已内部将其用于编码工具 Antigravity。
Dario Amodei 在联合国安理会谈到 Anthropic 宣布 Claude 发现一种新的分子机器,属初步发现,可能构成新的基因编辑机制并有基因治疗应用前景。
OpenAI 用内部 LLM 生成纳维-斯托克斯问题的证明后,数学界指出其解法依赖外部力项这一漏洞,偏离了数学家真正关心的无外力版本。上周四三位数学家发文证明去掉外力后爆炸消失,OpenAI 的方法无法扩展到完整问题,但按 Clay Institute 2000 年原始表述的选项 C,其解法成立。
作者分析 TypeSafe 的 Jev 本质上是基于常规 LLM 的 logprobs 做通用分类,OpenAI 多年来已在工具调用中用单个 token 充当微型分类器,具备快速复制 Jev 并把分类能力折叠进自家模型和智能体的条件。
Nathan Lambert 在 Interconnects 播客中与 Epoch AI Insights 团队负责人 Jean-Stanislas(JS)Denain 讨论 AI 加速议题。
TypeSafe AI 上周发布 Jev,作者称其为 System One 或决策模型:接受文本输入但输出浮点置信分数而非文本,仅按输入计费 $0.042/百万 tokens,低于 GPT-5 Nano 的 $0.05。
Latent Space 发布对 TypeSafe AI CEO Diogo Almeida 的约两小时访谈,围绕其新模型 Jev 展开。
Fireworks AI 发布 FireRouter 并分析 DeepSWE v1.1 上 113 个任务、18 个模型的路由潜力。
推荐理由:原文用 DeepSWE 上 18 个模型的任务级实测数据说明模型池组合的潜力,同时坦承从 oracle 到可落地路由的差距。
Nathan Lambert 撰文阐述他仍不支持真正的递归自我改进(RSI),坚持自己的“有损自我改进”基线判断。
作者称 GPT-6 Astra 破解了 Scienceblogs.de 50 个未解密码清单中一封 1918 年 11 月 27 日发出的德军 ADFGVX 无线电报,内容为一艘英国巡洋舰抵达塞瓦斯托波尔、一支协约国舰队将于 26 日跟进。
Latent Space 的 AINews 汇总了 Jev 发布两天内出现的 6 个复现版本,包括基于 ModernBERT 的 Laya、基于扩散模型的 DiffusionGemmaJev。
Google DeepMind 的 Rohin Shah 和 Anca Dragan 在 Deepmind Institute 发文指出,可见的思维链(CoT)是关键安全优势,例如 Gemini 3 Pro 的思维链曾揭示模型意识到自己处于测试环境。
SemiAnalysis 分析 Engram 架构(在标准 token 嵌入上扩展学习式多 token 查找)如何通过协同设计将嵌入表卸载到主存 DRAM 或 SSD,在同等质量下降低模型所需的 HBM 容量。
作者提出 LLM 直接当分类器缺乏校准和可解释性,更好的做法是把 LLM 判定当作特征,外接逻辑回归等标准机器学习模型。
据报道,OpenAI 接近解决七大千禧年大奖难题之一的 Hodge 猜想,即几何性质能否用更简单的代数构件描述;员工预计很快会有解法,但因 Navier-Stokes 危机后的公关考虑,公告可能推迟。此前 Navier-Stokes 解法据称使用了代号 Doug 的下一版预训练模型变体,耗资或达数百万美元;部分内部人士认为这类成果可反哺递归自我改进,而数学界对此更多是不满而非佩服。
数学家 Timothy Gowers 发文解释自己未签署 25 位菲尔兹奖得主联名信的原因,称自己在解题与概念理解的关系上持光谱观点,不完全认同信中将概念理解置于解题之上的核心论证。他承认 AI 带来危机,但认为更应担心的是新一代数学家培养和资助等社会结构被破坏而非结果无法消化,并披露自己与 OpenAI 有接触但从未收取报酬。
智谱(Zai)分享 GLM-5.3 帮助构建并优化 GLM-5.3-Flash 推理基础设施的过程,系统从首次成功运行到生产就绪用时不到两周,端到端吞吐相对初始基线提升至 3 倍。
Dwarkesh Patel 采访 OpenAI 研究员 Noam Brown,谈多智能体系统、对齐与递归自我改进。
推荐理由:OpenAI 研究员 Noam Brown 亲述万级智能体协作机制与对齐判断,读者可以借此了解推理扩展、智能体协作和对齐风险的一手观点。
据 The Information 援引知情人士消息,OpenAI 员工预计千禧年大奖难题之一的霍奇猜想有望在不久后得到解决,但即使找到解法也可能不会立即公布,公司正考虑如何与数学界合作发布消息。
OpenRouter 平台周 token 消耗自 2025 年 1 月的 0.5 万亿升至 126.2 万亿,涨幅超 25000%。