DeepMind 新任负责人 Koray Kavukcuoglu 力争年底前发布 Gemini 4,称 AGI 之争不是正确话题
Google DeepMind 负责人 Koray Kavukcuoglu 表示 Gemini 4 已处于早期后训练阶段,希望远在年底前发布,工程师已内部将其用于编码工具 Antigravity。
Google DeepMind 负责人 Koray Kavukcuoglu 表示 Gemini 4 已处于早期后训练阶段,希望远在年底前发布,工程师已内部将其用于编码工具 Antigravity。
Stanford 与 NVIDIA Research 团队发布 Contrastive Language Models(CLM)及 CLM-8B,用对比学习连接状态与动作,作为快速决策的 System One 模型。
Contrastive-LM 发布开放模型 CLM-8B,首个对比语言模型(CLM),不为生成文本而训练,而是对候选动作按当前状态打分并返回概率,主打与 TypeSafe AI 的 System One 模型 Jev 相同的接口。
研究团队发布 StudentBench 评估套件与公开平台,基于超过 175,000 条学生-AI 消息和 2,383 名参与者的数据,发现 AI 辅导在 GRE 学习增益上与专家人类辅导统计等效(p = .015),七个 GRE 领域中有五个领域表现最好的 AI 辅导者平均超过人类。
腾讯混元发布开源 MoE 大语言模型 Hunyuan-A13B,总参数 80B、推理仅激活 13B,以平衡能力、效率与部署成本。模型在经严格筛选的 20T token 语料上预训练并加强 STEM 数据,再经 SFT 和大规模强化学习;引入双模式 Chain-of-Thought 框架,简单问题用快思考、复杂多步问题用慢思考。
Artificial Analysis 页面显示,Inception 于 2026 年 9 月发布的 Mercury 2.5 是一个推理模型,输出速度达 770.4 tokens 每秒(同类价格档推理模型中位数为 108.6)。
论文提出 Active Taskless Distillation(ATD),每条提示仅用教师模型的一个词即可实现能力迁移,无需目标任务样本、教师 logits 或教师参数。
研究者提出 SAGE(Structural Admissibility-Guided Exploration)框架,通过代数稀疏化与双曲结构引导两种结构先验,缓解长程推理中的探索偏差与累积偏差。在 12 个基准、7 个模型族上,SAGE 优于竞争基线,在 Andrews-Curtis 问题上取得最高 8 倍提升。代码已开源。
Anthropic 宣布其湾区湿生物实验室借助 Claude 发现一个此前未知的酶系统,藏在噬菌体 DNA 中,能执行切割、复制、粘贴 DNA 等操作,性质令人联想到 CRISPR。
Fireworks Research 发布基于 Kimi K3 训练的专用模型 Ember-1,通过学习精简不必要的推理,在保持质量的同时减少约 35-50% 的 reasoning token。
推荐理由:官方给出了多组基准、A/B 测试和成本数据,读者可以据此评估用 Ember-1 替代 Kimi K3 降低推理 token 开销的可行性。
Dario Amodei 在联合国安理会谈到 Anthropic 宣布 Claude 发现一种新的分子机器,属初步发现,可能构成新的基因编辑机制并有基因治疗应用前景。
Baseten Base Labs 用 Qwen3 0.6B/1.7B/4B/8B 在 16 个推理任务上比较 GRPO 直接训练与先用 gpt-5.6-sol 教师解法做 SFT 再 RL。
Basecamp Research 获 1.4 亿美元融资,投资方包括 S32、Nvidia、Anthropic 的 Anthology Fund 和 NATO Innovation Fund,用于开发生物 AI 模型 EDEN 并推进体内细胞疗法进入临床。
阿里 Qwen 团队发布 Qwen-Audio-3.1,包含五款覆盖语音识别(ASR)、语音合成(TTS)和实时交互的模型。ASR 改进多语言和方言识别并自动清理填充词,ASR-Next 支持多说话人识别、时间戳及情绪和环境声检测;TTS-Next 将语言模型与扩散方法结合,可一次性生成语音、音效和背景音频。同步降价:TTS 约 70%,Realtime 约 85%,ASR 最高 95%。
OpenAI 用内部 LLM 生成纳维-斯托克斯问题的证明后,数学界指出其解法依赖外部力项这一漏洞,偏离了数学家真正关心的无外力版本。上周四三位数学家发文证明去掉外力后爆炸消失,OpenAI 的方法无法扩展到完整问题,但按 Clay Institute 2000 年原始表述的选项 C,其解法成立。
Kyutai 发布 Voice of Reason,两个基于 GLM-4-Voice-9B 的开源权重语音到语音模型,无需转写和独立文本 LLM 即可口头解数学题。
OpenAI 发布 GPT-6 系列两款新模型 GPT-6 Sol 与 Luna,API 定价相比 GPT-5.6 促销价下调约 50%,Sol 为每 1M tokens 输入 $2、输出 $10,Luna 为 $0.10、$0.50,两者已上线 API。
论文提出 AIDE²,一个让前沿 AI 研究智能体递归自我改进的系统:智能体提出对自身代码的修改,在 AI R&D 任务套件上基准测试修改版本,只保留隐藏评估表现最好的改动。
论文提出用证明长度与陈述长度之比衡量定理的内在有趣度,并证明其与下游实用性相关。作者训练了一个 27B 模型预测证明难度,准确率超过前沿通用模型;按该指标优化后,生成定理与 Mathlib 的实质性或完全重合率从 91.9% 降至 30.6%,系统可迭代构建自扩展的机器验证数学库。
Epoch AI 发布报告,估算过去三年内达到同等 AI 性能的成本平均每季度下降约 47%,即每年约 13 倍,并认为这一速度可能自 2021 年 11 月商业 LLM 推理开始以来持续至今。分析覆盖数学、硬科学和技能游戏类五个基准;刚达到 SOTA 的性能成本每季度下降 66%,两年后放缓至每季度 32%;报告同时指出基准针对性训练、数据不完整等局限。数据与代码在 GitHub 上公开。
推荐理由:报告用五个基准三年数据量化达到同等性能的成本下降速度,还区分了刚成为 SOTA 与两年后两种情形,数字和方法都值得细看。
OpenAI 发布 GPT-6 Sol 和 Luna 两款模型,token 价格较 GPT-5.6 Sol 和 Luna 下降一半,Sol 为每百万输入 token $2、输出 $10,Luna 为 $0.10/$0.50,同时提供缓存输入 token 九折优惠。
Arena 宣布 OpenAI 的 GPT-6 Sol 和 GPT-6 Luna 评分即将公布,邀请用户前往 Arena 实测并通过投票真实智能体任务支持其排行榜。
推荐理由:文中提及Peter用相同提示词和max reasoning对比GPT-6 Sol与GPT-5.6 Sol,覆盖输出、token用量和时延,可帮助读者了解两代模型差异。
Artificial Analysis 评测 OpenAI 的 GPT-6 Sol 和 Luna,两模型价格较 GPT-5.6 约减半,Sol 定价 $2/$10、Luna $0.10/$0.50 每百万输入/输出 token。
推荐理由:Artificial Analysis 用自家指数实测两代模型的成本与表现,读者可据此判断 GPT-6 降价后哪些能力持平或退步。
OpenAI 发布 GPT-6 Sol 和 GPT-6 Luna,将 GPT-6 Astra 的训练方法用于更快更便宜的模型,API 价格较 GPT-5.6 促销价下调 50%(Sol 输入 $4→$2、输出 $20→$10;Luna 输入 $0.20→$0.10、输出 $1.20→$0.50,每百万 token)。
推荐理由:官方发布给出各档模型的具体基准分数、API 价格降幅和缓存改进数据,可以用来对比 GPT-6 家族在成本与能力之间的取舍。
Artificial Analysis 评测页面显示 Claude Opus 5.5(Adaptive Reasoning, Max Effort, Default Fallback)在 Artificial Analysis Intelligence Index 得 58 分,远高于同类中位数 25。
OpenAI 发布 GPT-6 Sol 和 Luna 更新版,扩展本月早些时候推出的 GPT-6 Astra 系列。6 系列 API 价格为 5.6 系列 Sol 和 Luna 的一半,公司归因于缓存和推理改进;内部事实性评测显示 GPT-6 Sol 错误数约为前代一半,达到 Astra 级可靠性。
Anthropic 发布 Claude 5.5 系列首个模型 Claude Opus 5.5,官方称多数工作表现与 Claude Fable 5.1 相当,运行成本较 Opus 5 降低 40%,输入和输出 token 定价为每百万 $4 和 $20,输出速度快 30% 以上。
推荐理由:官方公告同时给出基准分数、完整定价表和防护措施细节,读者可以据此比较它相对 Opus 5 的成本与能力变化。
Anthropic 发布 Claude Opus 5.5,称其在多数任务上达到 Claude Fable 5.1 水平,总运营成本比 Opus 5 低约 40%,输出速度快 30% 以上。
作者分析 TypeSafe 的 Jev 本质上是基于常规 LLM 的 logprobs 做通用分类,OpenAI 多年来已在工具调用中用单个 token 充当微型分类器,具备快速复制 Jev 并把分类能力折叠进自家模型和智能体的条件。
Artificial Analysis 评测显示 Claude Opus 5.5 以 58 分登顶 Artificial Analysis Intelligence Index,为其实测最高分。