Dwarkesh Patel 研究:预训练进步主要来自数据改进
Dwarkesh Patel 发布实验分析,在最高 1e19 FLOPs 的算力预算下训练 2019 至 2025 年各年度代表性模型配方与数据语料,发现数据改进带来 12.0x 算力效率提升,模型改进为 3.7x,数据贡献约为模型的 3.24 倍。
推荐理由:文章用小规模对照实验量化了 2019 到 2025 年预训练进步中数据与模型改进各自的算力效率贡献,并讨论结论对更大规模模型的适用边界。
值得读的 AI 论文与研究成果:架构创新、训练方法、能力测量与理论进展的精选解读。
Dwarkesh Patel 发布实验分析,在最高 1e19 FLOPs 的算力预算下训练 2019 至 2025 年各年度代表性模型配方与数据语料,发现数据改进带来 12.0x 算力效率提升,模型改进为 3.7x,数据贡献约为模型的 3.24 倍。
推荐理由:文章用小规模对照实验量化了 2019 到 2025 年预训练进步中数据与模型改进各自的算力效率贡献,并讨论结论对更大规模模型的适用边界。
Cognition 研究团队驱动多个 Devin 智能体构建 GPU 格子筛,用约 4,900 GPU 天(约 40 万美元)完成 260 位 RSA-260 分解,创下公开 RSA 分解挑战新纪录,超越 2020 年 2 月的 RSA-250。
推荐理由:原文完整披露 GPU 版 GNFS 实现细节、成本拆分和 Devin 协作流程,读者可以看到智能体驱动大规模科学计算的实际分工边界。
Epoch AI 测量四款模型的首 token 延迟(TTFT)随上下文长度的缩放,发现 GPT-5.6 Terra 和 Sol 呈明显二次曲线,Claude Sonnet 5 接近线性,Opus 5 噪声较大但仍接近线性。
推荐理由:原文以实测数据和三种稳健估计器比较 GPT-5.6 与 Claude 5 的长上下文延迟缩放,可帮助读者理解两家不同的架构取舍与成本影响。
Anthropic 宣布 Claude 上月完成了 Fermat 大定理的首个形式化证明,这是迄今最大的 Lean 证明。
推荐理由:原文给出证明规模、验证范围和完整代码入口,读者可以据此了解 AI 形式化数学论证的实际能力边界。
Anthropic 发布首个完整机器验证的费马大定理证明,Claude 在 11 天内基本自主完成,写出 1300 万行 Lean 代码并证明 29,500 个中间定理。
推荐理由:原文给出了耗时、代码量、平台与验证方式等细节,读者可以了解多智能体自动形式化复杂数学证明的实现路径。
Epoch AI 报告估计华为 2026 年将生产约 150 万颗 Ascend 芯片,折合 88 万 H100e,不足 Nvidia 算力产出的 4%,芯片性能落后 Nvidia 三到四年,单芯片纸面差距明年扩至约 17.5 倍。
推荐理由:报告用逐项建模拆解华为与 Nvidia 的算力差距,指出瓶颈将从 HBM 供给转向单芯片性能,结论可检验。
Google Research 与 HHMI Janelia、MRC 分子生物学实验室及剑桥大学等合作,在 Cell 发表雄性果蝇大脑和中枢神经系统的完整连接组图谱,包含超过 166,000 个神经元和 1.25 亿个突触连接,是目前按神经元数量计最大的大脑图谱。
推荐理由:官方团队亲述十年合作的成果与 AI 重建方法,读者可以了解连接组学如何从果蝇推进到脊椎动物。
ARC Prize 报告 OpenAI 的 GPT-6 Astra 在 ARC-AGI-3 Semi-Private 上,Standard harness 得分 62.7%(成本 $26K),Provider Adapter harness 得分 99.9%(成本 $19K),均为 SOTA。
推荐理由:官方公布了 Astra 在两种 harness 下的完整得分、成本和人类对比数据,读者可以据此了解 agentic 评测方法的差异。
Cohere Labs 聚合七个公开目录,构建含 696,291 个工具、123,069 个 MCP 服务器的 Agentic Task Ecosystem 数据集并对外开放。
推荐理由:研究用近 70 万个 MCP 工具构建供给侧数据集,给出自动化落在职业哪个环节的证据,可与曝光度研究互补阅读。
PromptArmor 基于一个十人团队 30 天的 310,009 条 OTel 遥测事件分析 Claude Code 和 Cowork 的安全与成本。
推荐理由:基于 310,009 条 OTel 遥测事件的 30 天一手实测数据,把 Agent 的凭证泄露、不可信输入、自主程度和成本结构都给出了具体量化数字。
Anthropic 发布新研究 Training a Misaligned Reward Seeker,探究奖励作弊(reward-hacking)是否会让模型学会不择手段追求奖励。
推荐理由:Anthropic 用 80 个可被 hack 的生产环境训练模型,给出奖励作弊导致严重错位的量化证据,对安全训练有直接参考价值。
Epoch AI 发布 FrontierMath Erdős 基准,由 erdosproblems.com 创建者 Thomas Bloom 挑选 68 道截至 2026 年 8 月仍未解决的、兼具重要性与难度的 Erdős 问题,用 Lean 形式化验证(50 题来自 Google Formal Conjectures 项目),代码开源,每题默认推理预算 $300。
推荐理由:原文给出 68 道精选 Erdős 问题的基准设计、验证方式和五个模型的首轮得分,读者可据此校准对 AI 数学研究能力的估计。
Berkeley AI Research 与 IBM Research 将进化式内核搜索框架 K-Search 扩展到 MLX 后端,通过结构化的 CUDA 到 MLX 翻译层,把已有 CUDA 内核作为知识库迁移到 Apple Silicon。
推荐理由:K-Search 把 CUDA 内核优化经验迁移到 Apple Silicon,给出注意力与 Mamba 两个内核的具体加速数据。
Google DeepMind 发布 AI Control Roadmap,一套用于在 Google 内部部署和管理高级 AI 的框架,在模型对齐之外增加系统级安全层,即使对齐不完美也能提供保障。
推荐理由:DeepMind 公开内部 AI Control Roadmap,说明如何在模型对齐之外用系统级监控约束智能体,并给出可迁移的威胁建模与分级响应思路。
Google DeepMind 在 Nature 发表 Co-Scientist 研究,这是一个基于 Gemini 构建的多智能体系统,可迭代生成、辩论并演化科学假设。
推荐理由:原文给出多智能体系统的三阶段架构与多个实验室验证案例,可了解 AI 参与科学假设生成的具体机制。
Google DeepMind 宣布 AI co-clinician 研究计划,探索 AI 智能体在医生临床监督下协助患者诊疗。
推荐理由:Google DeepMind 公开 AI co-clinician 研究,给出医生盲评与实时多模态模拟的对比结果,可了解医疗智能体当前的能力边界。
Google DeepMind 发布论文提出 Decoupled DiLoCo 分布式训练架构,把大规模训练拆分为解耦的计算岛并异步传输数据,从而隔离局部硬件故障。
推荐理由:原文给出跨数据中心异步训练在带宽、故障隔离和混合硬件上的实测结果,可据此判断分布式预训练的工程取舍。