推荐理由:原文补充了数据隔离说明,并指出其 Euler 情形证明结果与 Alpöge 和 Buckmaster 的工作不同,读者可据此比较两条独立证明路径。
推理能力
全部主题模型推理能力的进展:思维链、推理模型、数学与逻辑基准的突破与争议。
最新精选
第 41–60 条 · 共 68 条
OpenAI@OpenAI精选AI 评分7474
Epoch AI:研究、数据与评测精选AI 评分6969 Epoch AI 实测 GPT-5.6 与 Claude 5 长上下文延迟缩放差异
Epoch AI 测量四款模型的首 token 延迟(TTFT)随上下文长度的缩放,发现 GPT-5.6 Terra 和 Sol 呈明显二次曲线,Claude Sonnet 5 接近线性,Opus 5 噪声较大但仍接近线性。
推荐理由:原文以实测数据和三种稳健估计器比较 GPT-5.6 与 Claude 5 的长上下文延迟缩放,可帮助读者理解两家不同的架构取舍与成本影响。
Tomer Tunguz 博客(VC 分析)精选AI 评分6565 Tomer Tunguz 解析 AI 消耗的三波浪潮:从聊天到智能体再到 meta-harness
VC Tomer Tunguz 提出 AI token 消耗分三波:聊天约 1m tokens/人/天,单智能体约 100m–200m tokens/天,meta-harness 并行调度多智能体可达数十亿。
推荐理由:作者提出 AI 消耗分三波叠加增长的框架,并用 OpenRouter 与企业数据解释为何线性外推算力需求会失真。
OpenAI:官网动态(RSS · 排除企业/客户案例)精选AI 评分8282 OpenAI 发布内部研究加速报告:已达成自动化研究实习生目标,推进 2028 年 3 月自动化 AI 研究员
OpenAI 发文披露自动化研究进展,宣布已达成去年秋天设定的今年 9 月拥有自动化研究实习生(可在人类指导下完成耗时数天的明确研究任务)的目标,并计划在 2028 年 3 月前造出自动化 AI 研究员。
推荐理由:OpenAI 以内部数据披露 coding agent 对研究工作的实际影响和 RSI 进展,读者可以据此了解前沿实验室的自动化研究现状。
OpenAI:官网动态(RSS · 排除企业/客户案例)精选AI 评分8888 OpenAI 发布 GPT-6 Astra:多项基准刷新纪录, cybersecurity 能力达 Critical 阈值
OpenAI 发布新一代模型 GPT-6 Astra,称其在计算机使用、软件工程、科学和网络安全等方向达到 SOTA。
推荐理由:官方发布给出多项评测数字、定价和可用渠道,读者可以据此比较它相对前代和竞品的能力与成本变化。
Sam Altman@sama精选AI 评分8080推荐理由:原文确认 GPT-6 Astra 的用户覆盖范围扩大到 Plus 和 Business,读者可以据此判断自己的可用入口和时间点。
Anthropic@AnthropicAI精选AI 评分7676Anthropic 宣布 Claude 上月完成了 Fermat 大定理的首个形式化证明,这是迄今最大的 Lean 证明。
推荐理由:原文给出证明规模、验证范围和完整代码入口,读者可以据此了解 AI 形式化数学论证的实际能力边界。
Anthropic:Research(发表成果 · 网页)精选AI 评分8080 Claude 用 11 天完成费马大定理的首个完整机器验证证明
Anthropic 发布首个完整机器验证的费马大定理证明,Claude 在 11 天内基本自主完成,写出 1300 万行 Lean 代码并证明 29,500 个中间定理。
推荐理由:原文给出了耗时、代码量、平台与验证方式等细节,读者可以了解多智能体自动形式化复杂数学证明的实现路径。
The Decoder:AI News(RSS)精选AI 评分7878 GPT-6 Astra 基准表现分歧,ARC-AGI-3 效率超人类令 Chollet 提前 AGI 预测
GPT-6 Astra 的基准结论相互矛盾:Epoch AI 以 169 分将其排在 267 个模型之首,Artificial Analysis 给出 61 分,仅与前代 Sol 持平、落后 Claude Fable 5.1 的 66 分。
推荐理由:原文汇总多家基准分歧数据并梳理 ARC-AGI-3 效率细节,读者可以借此理解 GPT-6 Astra 各项成绩的真实含义。
Hacker News 热门(buzzing.cc 中文翻译)精选AI 评分7777 开发者用 Claude Fable 5 在 Claude Code 中将 1993 年 Amiga 游戏 Babylonian Twins 移植到 Godot
作者让 Claude Fable 5 在 Claude Code 中分三步移植其 1993 年 Amiga 游戏:34,000 行 C++ 一个晚上迁入 Godot 4,72,758 行无注释 68000 汇编先用 vasm 重建出与发售版字节一致的二进制再移植,并把 1993 原作作为第二启动项嵌入新游戏。
推荐理由:作者亲历者复盘用 LLM 移植 68000 汇编的完整过程,给出可验证的字节级校验方法和多处 AI 出错的实例。
Gary Marcus:The Road to AI We Can Trust(RSS)精选AI 评分7474 Gary Marcus 评 GPT-6 Astra:进步明显但鲁棒性与可监控性存疑
Gary Marcus 发文点评 GPT-6 Astra,称多项报告显示其为真正的进步,OpenAI 产品显式创建并操纵符号世界模型,令其近十年的主张获得印证。
推荐理由:作者结合自身近十年主张神经符号世界模型的立场,指出 Astra 的关键未知在鲁棒性与可监控性,判断有具体依据。
Greg Brockman@gdb精选AI 评分7272推荐理由:转发 ARC Prize 对 GPT-6 Astra 的评测数据,标准与 Provider Adapter 两种 harness 分差大,可据此了解 harness 对得分的影响。
Aravind Srinivas@AravSrinivas精选AI 评分7070推荐理由:Perplexity CEO 确认 GPT-6 Astra 在其评测中领先,并宣布将向 Pro 和 Max 用户开放。
Rohan Paul@rohanpaul_ai精选AI 评分7878推荐理由:作者梳理了 GPT-6 Astra 系统卡中关于链式思维可控性与监控性下降的关键安全发现,读者可借此了解对齐评估的核心结论。
Sherwin Wu@sherwinwu精选AI 评分6666推荐理由:结合 Arc Prize 负责人的预估与半年即饱和的结果,读者可以借此对照自己对前沿模型进展速度的预期。
François Chollet@fchollet精选AI 评分8181推荐理由:ARC Prize 作者基于自家标准 harness 的实测数据评估 GPT-6 Astra,读者可对比 66% 与近 100% 两种设置看模型与 harness 能力的边界变化。
Hacker News 热门(buzzing.cc 中文翻译)精选AI 评分7878 IFM 发布 K2 Horizon 六款开源模型,覆盖 0.9B 到 375B-A23B 并开放完整训练生命周期
IFM 发布 K2 Horizon 模型系列,共六个模型:375B-A23B、36B-A4B、32B、7B、3.7B 和 0.9B,均以 Apache 2.0 开源,其中 0.9B、3.7B 和 7B 宣称在其规模上达到 SOTA,36B-A4B 采用新提出的稀疏注意力架构 MoVA。
推荐理由:原文在发布模型之外还放出从预训练到智能体后训练的全流程产物,研究者可以据此复现和改造整套训练方法。
TechCrunch:AI(RSS)精选AI 评分8181 OpenAI 发布新模型 Astra,主打计算机与浏览器操作但因 opaque recurrence 引发争议
OpenAI 发布最新模型 Astra,称其为迄今最强大模型,主打计算机和浏览器操作,先面向 Daybreak 网络安全计划客户开放,随后一周内覆盖 Pro、Plus、Enterprise、Business 付费账户及 API。
推荐理由:原文梳理了 Astra 的能力主张、发布节奏,以及 opaque recurrence 引发的可监控性争议,信息较为完整。
NVIDIA Technical Blog:Agentic AI / Generative AI精选AI 评分6969 NVIDIA 讲解如何在 Jetson 上部署和优化推理模型
NVIDIA 发布教程,讲解在 Jetson 上部署新一代开放推理模型的方法,以 Nemotron 3.5 Lightning 和 Qwen3.8-27B 为例。
推荐理由:官方教程给出模型选型、NVFP4 量化与投机解码配置和实测吞吐数据,可迁移到自己的 Jetson 部署流程。
Google DeepMind:Blog(RSS)精选AI 评分7878 Google DeepMind 发布 Gemini 3.8 Flash 与 3.8 Flash Cyber 两款新模型
Google DeepMind 发布 Gemini 3.8 Flash 与 3.8 Flash Cyber。
推荐理由:官方给出两版模型的定价、基准成绩和实际安全应用数据,读者可据此评估在新旧 Flash 模型间的迁移与选型。