跳到正文

论文研究

值得读的 AI 论文与研究成果:架构创新、训练方法、能力测量与理论进展的精选解读。

最新精选

第 21–37 条 · 共 37 条
9月9日周三
  1. Dwarkesh Patel:Podcast & Blog(RSS)60

    Dwarkesh Patel 研究:预训练进步主要来自数据改进

    Dwarkesh Patel 发布实验分析,在最高 1e19 FLOPs 的算力预算下训练 2019 至 2025 年各年度代表性模型配方与数据语料,发现数据改进带来 12.0x 算力效率提升,模型改进为 3.7x,数据贡献约为模型的 3.24 倍。

    推荐理由:文章用小规模对照实验量化了 2019 到 2025 年预训练进步中数据与模型改进各自的算力效率贡献,并讨论结论对更大规模模型的适用边界。

  2. Cognition 模型 / Devin 博客(网页)76

    Cognition 团队用 Devin 完成 RSA-260 分解,刷新公开 RSA 挑战纪录

    Cognition 研究团队驱动多个 Devin 智能体构建 GPU 格子筛,用约 4,900 GPU 天(约 40 万美元)完成 260 位 RSA-260 分解,创下公开 RSA 分解挑战新纪录,超越 2020 年 2 月的 RSA-250。

    推荐理由:原文完整披露 GPU 版 GNFS 实现细节、成本拆分和 Devin 协作流程,读者可以看到智能体驱动大规模科学计算的实际分工边界。

9月8日周二
  1. Epoch AI:研究、数据与评测69

    Epoch AI 实测 GPT-5.6 与 Claude 5 长上下文延迟缩放差异

    Epoch AI 测量四款模型的首 token 延迟(TTFT)随上下文长度的缩放,发现 GPT-5.6 Terra 和 Sol 呈明显二次曲线,Claude Sonnet 5 接近线性,Opus 5 噪声较大但仍接近线性。

    推荐理由:原文以实测数据和三种稳健估计器比较 GPT-5.6 与 Claude 5 的长上下文延迟缩放,可帮助读者理解两家不同的架构取舍与成本影响。

9月5日周六
  1. Anthropic:Research(发表成果 · 网页)80

    Claude 用 11 天完成费马大定理的首个完整机器验证证明

    Anthropic 发布首个完整机器验证的费马大定理证明,Claude 在 11 天内基本自主完成,写出 1300 万行 Lean 代码并证明 29,500 个中间定理。

    推荐理由:原文给出了耗时、代码量、平台与验证方式等细节,读者可以了解多智能体自动形式化复杂数学证明的实现路径。

9月4日周五
  1. Epoch AI:研究、数据与评测65

    Epoch AI 分析华为 AI 芯片路线图,判断 2030 年前难以追上 Nvidia

    Epoch AI 报告估计华为 2026 年将生产约 150 万颗 Ascend 芯片,折合 88 万 H100e,不足 Nvidia 算力产出的 4%,芯片性能落后 Nvidia 三到四年,单芯片纸面差距明年扩至约 17.5 倍。

    推荐理由:报告用逐项建模拆解华为与 Nvidia 的算力差距,指出瓶颈将从 HBM 供给转向单芯片性能,结论可检验。

  2. Google Research:Blog(网页)66

    Google 与 HHMI Janelia 发布完整雄性果蝇大脑连接组图谱

    Google Research 与 HHMI Janelia、MRC 分子生物学实验室及剑桥大学等合作,在 Cell 发表雄性果蝇大脑和中枢神经系统的完整连接组图谱,包含超过 166,000 个神经元和 1.25 亿个突触连接,是目前按神经元数量计最大的大脑图谱。

    推荐理由:官方团队亲述十年合作的成果与 AI 重建方法,读者可以了解连接组学如何从果蝇推进到脊椎动物。

9月3日周四
  1. ARC Prize:官方博客79

    ARC Prize 发布 OpenAI GPT-6 Astra 在 ARC-AGI-3 上的评测结果

    ARC Prize 报告 OpenAI 的 GPT-6 Astra 在 ARC-AGI-3 Semi-Private 上,Standard harness 得分 62.7%(成本 $26K),Provider Adapter harness 得分 99.9%(成本 $19K),均为 SOTA。

    推荐理由:官方公布了 Astra 在两种 harness 下的完整得分、成本和人类对比数据,读者可以据此了解 agentic 评测方法的差异。

9月2日周三
9月1日周二
  1. Epoch AI:研究、数据与评测64

    Epoch AI 发布 FrontierMath Erdős 基准:用 Lean 验证的 68 道未解 Erdős 问题评测 AI 数学能力

    Epoch AI 发布 FrontierMath Erdős 基准,由 erdosproblems.com 创建者 Thomas Bloom 挑选 68 道截至 2026 年 8 月仍未解决的、兼具重要性与难度的 Erdős 问题,用 Lean 形式化验证(50 题来自 Google Formal Conjectures 项目),代码开源,每题默认推理预算 $300。

    推荐理由:原文给出 68 道精选 Erdős 问题的基准设计、验证方式和五个模型的首轮得分,读者可据此校准对 AI 数学研究能力的估计。

7月29日周三
  1. Berkeley AI Research60

    从 CUDA 到 MLX:K-Search 如何把内核优化经验带到 Apple Silicon

    Berkeley AI Research 与 IBM Research 将进化式内核搜索框架 K-Search 扩展到 MLX 后端,通过结构化的 CUDA 到 MLX 翻译层,把已有 CUDA 内核作为知识库迁移到 Apple Silicon。

    推荐理由:K-Search 把 CUDA 内核优化经验迁移到 Apple Silicon,给出注意力与 Mamba 两个内核的具体加速数据。

6月16日周二
  1. Google DeepMind62

    Google DeepMind 发布 AI Control Roadmap,用系统级安全约束 AI 智能体

    Google DeepMind 发布 AI Control Roadmap,一套用于在 Google 内部部署和管理高级 AI 的框架,在模型对齐之外增加系统级安全层,即使对齐不完美也能提供保障。

    推荐理由:DeepMind 公开内部 AI Control Roadmap,说明如何在模型对齐之外用系统级监控约束智能体,并给出可迁移的威胁建模与分级响应思路。

5月12日周二
4月30日周四
4月22日周三