OpenAI 公布前沿模型在数学开放问题上的新结果
OpenAI 发布内部前沿模型在数学开放问题上的新结果,并公开 Lean 证明形式化及研究细节。相关材料已发布在 GitHub 上。
推荐理由:OpenAI 公开内部前沿模型在数学开放问题上的结果,并同步放出 Lean 证明形式化与细节,可供研究者直接复核。
OpenAI 发布内部前沿模型在数学开放问题上的新结果,并公开 Lean 证明形式化及研究细节。相关材料已发布在 GitHub 上。
推荐理由:OpenAI 公开内部前沿模型在数学开放问题上的结果,并同步放出 Lean 证明形式化与细节,可供研究者直接复核。
OpenAI 发布 GPT-6 家族模型指南,面向初创公司讲解如何选择 GPT-6 模型、调节推理强度、优化提示词与技能、协调工具调用,并为生产环境准备相应工作流。
GPT-6 Astra Ultrafast 已在 OpenAI API 上线,并向符合条件的 ChatGPT Work 和 Codex 用户开放,运行在 NVIDIA Blackwell GPU 上。
推荐理由:原文给出 Ultrafast 相对标准模式的加速幅度与开放入口,读者可据此判断它对编码智能体循环的实际影响。
NVIDIA 发布开源表格基础模型 Kumo Tabular,对带标签表格做单次前向推理即可完成分类和回归,无需训练、调参或特征工程。
推荐理由:官方技术博客披露了架构、纯人工数据预训练配方和四项基准成绩,读者可据此评估其替换梯度提升树的可行性。
苹果研究者提出往返协议,用生成器把算术表达式转成文字题、再由独立提取器还原,并以符号等价作为精确判定,测试十六个模型的所有两两组合。结果显示该通道有损且不对称:交换生成与提取模型可使准确率相差最多 60.4 个百分点,最佳组合达 92.9%;至少 73.6% 的失败源于生成端,难度由树结构而非模型家族决定。
小红书 AllSpark 团队提出 PACT(Policy Aligned Critic Training),通过三个正则条件唯一确定长程 Agent 的信用分配,并用 BCE 回归有界 Value、采用 Actor-Then-Critic 更新顺序改进 Critic 与策略对齐。
Artificial Analysis 发布对 Claude Sonnet 5.5 的评测:其智能指数得分 56,max effort 下比 Sonnet 5 高 18 分,升至第 2 名,仅落后 Opus 5.5 (max)。
推荐理由:Artificial Analysis 实测指出 Sonnet 5.5 逼近 Opus 5.5 依赖约 193k 输出 token,成本细节对选型有直接参考价值。
推荐理由:原文给出具体排名、分数差和混合价格,读者可据此比较 Claude Opus 5.5 与前代的性价比位置。
物理学家 Matt von Hippel 发起的挑战达成:Anthropic 的 Liam Fitzpatrick 与 Siddharth Mishra-Sharma 用 Claude Science(harness)让 Claude 直接算出 planar N=4 super Yang-Mills 六粒子振幅九圈结果。
推荐理由:作者以其曾判定过难的本领域前沿计算为参照,评估了 Claude Science 的实际能力与可推广性,提供了来自领域专家的一手判断。
Fireworks Research 发布基于 Kimi K3 训练的专用模型 Ember-1,通过学习精简不必要的推理,在保持质量的同时减少约 35-50% 的 reasoning token。
推荐理由:官方给出了多组基准、A/B 测试和成本数据,读者可以据此评估用 Ember-1 替代 Kimi K3 降低推理 token 开销的可行性。
Baseten Base Labs 用 Qwen3 0.6B/1.7B/4B/8B 在 16 个推理任务上比较 GRPO 直接训练与先用 gpt-5.6-sol 教师解法做 SFT 再 RL。
Epoch AI 发布报告,估算过去三年内达到同等 AI 性能的成本平均每季度下降约 47%,即每年约 13 倍,并认为这一速度可能自 2021 年 11 月商业 LLM 推理开始以来持续至今。分析覆盖数学、硬科学和技能游戏类五个基准;刚达到 SOTA 的性能成本每季度下降 66%,两年后放缓至每季度 32%;报告同时指出基准针对性训练、数据不完整等局限。数据与代码在 GitHub 上公开。
推荐理由:报告用五个基准三年数据量化达到同等性能的成本下降速度,还区分了刚成为 SOTA 与两年后两种情形,数字和方法都值得细看。
Arena 宣布 OpenAI 的 GPT-6 Sol 和 GPT-6 Luna 评分即将公布,邀请用户前往 Arena 实测并通过投票真实智能体任务支持其排行榜。
推荐理由:文中提及Peter用相同提示词和max reasoning对比GPT-6 Sol与GPT-5.6 Sol,覆盖输出、token用量和时延,可帮助读者了解两代模型差异。
Artificial Analysis 评测 OpenAI 的 GPT-6 Sol 和 Luna,两模型价格较 GPT-5.6 约减半,Sol 定价 $2/$10、Luna $0.10/$0.50 每百万输入/输出 token。
推荐理由:Artificial Analysis 用自家指数实测两代模型的成本与表现,读者可据此判断 GPT-6 降价后哪些能力持平或退步。
OpenAI 发布 GPT-6 Sol 和 GPT-6 Luna,将 GPT-6 Astra 的训练方法用于更快更便宜的模型,API 价格较 GPT-5.6 促销价下调 50%(Sol 输入 $4→$2、输出 $20→$10;Luna 输入 $0.20→$0.10、输出 $1.20→$0.50,每百万 token)。
推荐理由:官方发布给出各档模型的具体基准分数、API 价格降幅和缓存改进数据,可以用来对比 GPT-6 家族在成本与能力之间的取舍。
Anthropic 发布 Claude 5.5 系列首个模型 Claude Opus 5.5,官方称多数工作表现与 Claude Fable 5.1 相当,运行成本较 Opus 5 降低 40%,输入和输出 token 定价为每百万 $4 和 $20,输出速度快 30% 以上。
推荐理由:官方公告同时给出基准分数、完整定价表和防护措施细节,读者可以据此比较它相对 Opus 5 的成本与能力变化。
Artificial Analysis 评测显示 Claude Opus 5.5 以 58 分登顶 Artificial Analysis Intelligence Index,为其实测最高分。
Nathan Lambert 在 Interconnects 播客中与 Epoch AI Insights 团队负责人 Jean-Stanislas(JS)Denain 讨论 AI 加速议题。
推荐理由:Artificial Analysis 实测 Step 5 Preview 的得分、成本与智能体短板,读者可据此对比同分段模型的表现与性价比。
Xiaomi MiMo 于今日正式发布并开源 MiMo-V2.6 系列模型,包含 Pro 与 Flash 两个原生全模态模型,称这是探索 RSI(递归自我改进)路径的关键一步。
xAI 发布 Grok 4.7,定位为其最强编码与知识工作模型,定价 $2/百万输入 token、$6/百万输出 token,与 Grok 4.6 同价同速,另有速度和价格加倍的快速变体。
推荐理由:官方给出了完整定价、速度和多项基准对比,读者可以据此把 Grok 4.7 放进现有模型选型里横向比较。
TypeSafe 的决策模型 Jev 已可通过 OpenRouter Decisions API 调用,模型 ID 为 typesafe/jev-1.13,于 2026 年 9 月 15 日发布早期访问。
推荐理由:文章给出 Jev 三种决策原语、真实 API 响应和调用代码,开发者可据此判断如何用它替代 LLM 加正则的解析流程。
Fireworks AI 发布 FireRouter 并分析 DeepSWE v1.1 上 113 个任务、18 个模型的路由潜力。
推荐理由:原文用 DeepSWE 上 18 个模型的任务级实测数据说明模型池组合的潜力,同时坦承从 oracle 到可落地路由的差距。
阶跃星辰发布旗舰基座模型 Step 5 Preview,采用稀疏 MoE 架构,总参数量 600B、激活 27B,支持 100 万 Token 上下文和文本与视觉输入,在 Artificial Analysis Intelligence Index 得 44 分,居全球开源模型前三,单任务成本为 Claude Opus 5 的 1/8。
推荐理由:官方完整公布架构参数、基准成绩和权重开放时间,读者可据此评估其在开源主力模型中的成本能力位置。
Nathan Lambert 撰文阐述他仍不支持真正的递归自我改进(RSI),坚持自己的“有损自我改进”基线判断。
OpenAI 发布 Astra for Law,将 GPT-6 Astra 配合法律搜索索引和 Legal 分析写作指令,面向律所和法律科技公司。在 Vals AI Legal Research Bench 私有验证集 200 道美国法律研究题上,最高推理强度下整体正确率 54.0%,比仅用网页搜索的 GPT-6 Astra 的 38.7% 相对提升 40%。
Anthropic 让 Claude 在不到四周内优化了超过 30 个开源生物分子模型,平均提速约 4 倍、精度损失极小,输出完全一致时也有近 2 倍加速。优化代码全部开源,还推出低内存 Big 模式,可在单张 NVIDIA GPU 节点上对超过 10,000 token 的生物分子系统做准确预测。
推荐理由:Anthropic 公布了完整提速数据、开源代码和比赛入口,读者可以据此评估 AI 优化科学计算代码的实际水平。
Dwarkesh Patel 采访 OpenAI 研究员 Noam Brown,谈多智能体系统、对齐与递归自我改进。
推荐理由:OpenAI 研究员 Noam Brown 亲述万级智能体协作机制与对齐判断,读者可以借此了解推理扩展、智能体协作和对齐风险的一手观点。
NVIDIA Vera Rubin NVL72 首次提交 MLPerf Inference v6.1 preview 结果,Qwen3-VL 上吞吐最高达 GB300 NVL72 的 3.7 倍,DeepSeek-R1 上最高 2.5 倍。