OpenAI 公布前沿模型在数学开放问题上的新结果
OpenAI 发布内部前沿模型在数学开放问题上的新结果,并公开 Lean 证明形式化及研究细节。相关材料已发布在 GitHub 上。
推荐理由:OpenAI 公开内部前沿模型在数学开放问题上的结果,并同步放出 Lean 证明形式化与细节,可供研究者直接复核。
OpenAI 发布内部前沿模型在数学开放问题上的新结果,并公开 Lean 证明形式化及研究细节。相关材料已发布在 GitHub 上。
推荐理由:OpenAI 公开内部前沿模型在数学开放问题上的结果,并同步放出 Lean 证明形式化与细节,可供研究者直接复核。
哈佛物理学家 Matthew Schwartz 在 Anthropic 客座博文中介绍开源工具 BootLoops,它让 Claude 完成精确科学计算,三个月内团队在 18 个领域产出 36 篇手稿、19 位合著者。
一项 arXiv 研究(https://arxiv.org/abs/2609.25021)发现 chat template 像开关一样控制 LLM 的自指语气:8 个 9B 以下开源 instruct 模型加模板时免责声明语气(如"I'm just an AI")达 53%、体验性语气("I feel")仅 1%,去掉模板后变为 36% 和 15%。
arXiv 论文介绍 YuE2,通过符号规划统一符号与音频音乐生成,单一 AR-NAR Mixture-of-Transformers 先生成可读乐谱,再扩展为语义音乐 token 并实现全曲音频。
Rufus-Air 发布了在 GLM-4.5-Air-Base(106B-A12B)上可复现的开源后训练配方,按 SFT、Reasoning RL、Coding RL、Instruction-Following RL、通用 Agent、Coding Agent、Search Agent 和 RLHF 八个阶段串行组织。
腾讯混元发布开源 MoE 大语言模型 Hunyuan-A13B,总参数 80B、推理仅激活 13B,以平衡能力、效率与部署成本。模型在经严格筛选的 20T token 语料上预训练并加强 STEM 数据,再经 SFT 和大规模强化学习;引入双模式 Chain-of-Thought 框架,简单问题用快思考、复杂多步问题用慢思考。
Anthropic 让 Claude 在不到四周内优化了超过 30 个开源生物分子模型,平均提速约 4 倍、精度损失极小,输出完全一致时也有近 2 倍加速。优化代码全部开源,还推出低内存 Big 模式,可在单张 NVIDIA GPU 节点上对超过 10,000 token 的生物分子系统做准确预测。
推荐理由:Anthropic 公布了完整提速数据、开源代码和比赛入口,读者可以据此评估 AI 优化科学计算代码的实际水平。
NVIDIA 论文提出 Agora,把多个研究智能体的共享记忆记录为 Git 中只增不改的 DAG,每个结果、假设和验证都是不可变 commit,父边标明依赖关系,索引列出开放分支与验证状态。
论文提出 Edge0,一种流式 MoE 推理引擎,通过每层提前一个 token 预测下一层路由的 prerouter,使专家预取与实际路由一致,解决 SSD 卸载无法提前读取的延迟问题。
Mozilla 发布 91 页报告称开放权重 AI 目前仅落后前沿约 4 个月。OpenRouter 上 8 月 token 量前十的模型有 8 个是开放权重。
论文提出 Agora,用 Git 存储的只追加有向无环图作为智能体共享记忆,每条结果、洞察或验证都是可检出复现的 commit。
蚂蚁集团发布基于 Ling-3.0-flash 的金融开源权重模型 Ling-3.0-flash-Fin,在 Artificial Analysis Intelligence Index 得 23 分,Finance & Accounting Index 得 24 分。
ZGCM-1 是一个完全开源的 7B 稠密基础模型,从零训练,主打在 256K 上下文中结合内部思考与外部工具调用,在数学推理和智能体搜索任务上可媲美 Qwen3-235B-A22B、GLM-5.1 等更大的前沿模型。
作者发布 Gander 技术报告,这是一个端到端模型,在单一框架内统一全模态感知、实时交互与智能体能力,支持视频、语音、文本流式输入与随时打断的全双工交互。其采用 Cerebellum-Brain 协同框架,小脑负责实时交互与对话,大脑负责复杂推理与智能体任务,并基于流式 Thinker-Talker 架构实现低延迟;模型、代码和数据将开源。
Miles v0.1 是一个全栈、生产就绪的前沿后训练系统,围绕 slime 的设计,将 RL 训练循环各环节按可验证、干净、可定制的原则构建,并已在 https://github.com/radixark/miles 开源。
NVIDIA 基于 Nemotron 3 Ultra 训练 SFT 与 RL 两个专精检查点,结合生成-验证-精炼的测试时推理流水线,在 IMO 2026 正式得分 30/42,超过 29 分的金牌线,全程不使用形式化证明器、外部工具或联网。
论文提出以数据为中心的 Feyospace-v1 框架,通过五套系统与可重置的编码、漏洞、CTF、内核历史、完整利用、固件和设备环境生成数据,经执行验证和证据审计后保留 164,269 条轨迹用于长上下文监督微调。
Meta FAIR、牛津大学和 UCL 团队提出 AI Research Preference Models(RPMs),在执行前对未运行的 ML 实验候选排序,只执行获胜者。
上海人工智能实验室提出 Harness-of-Harness(HoH)框架,让编码智能体在多次迭代间持续携带代码、测试证据、已知问题和更新后的计划。
arXiv 论文(2609.04010)提出 diffusion-augmented LLMs,即 Uno,一类在自回归模型分布上用扩散并行抽取多个 token 的新模型。
Anthropic 宣布 Claude 上月完成了 Fermat 大定理的首个形式化证明,这是迄今最大的 Lean 证明。
推荐理由:原文给出证明规模、验证范围和完整代码入口,读者可以据此了解 AI 形式化数学论证的实际能力边界。
DRACO 提出在结果信号缺失的长程智能体训练中,动态生成评分标准并按轨迹打分,再把判断以闭式方法重分配到相关步骤,在 GRPO 中产生差异化逐步优势,不引入任何训练的归因模块。
论文提出 compile by training,把自然语言规格编译为可复用的神经函数:编译时由教师模型生成任务样例,训练紧凑解释器的小型 adapter,运行时无需教师模型,可像普通软件一样存储、版本化和组合。
Minima 对 Qwen3.8-27B(48 层 GDN、16 层注意力)的全部 496 个线性层(含 GDN)应用 NVFP4 W4A4 量化,在 MMLU-Pro。
LLaDA-Image 是一个统一框架,包含从零训练的 6B Diffusion Transformer 和基于 LLaDA2.0-Mini 扩散语言模型骨干的冻结视觉语言理解模块。
Google Research 与 HHMI Janelia、MRC 分子生物学实验室及剑桥大学等合作,在 Cell 发表雄性果蝇大脑和中枢神经系统的完整连接组图谱,包含超过 166,000 个神经元和 1.25 亿个突触连接,是目前按神经元数量计最大的大脑图谱。
推荐理由:官方团队亲述十年合作的成果与 AI 重建方法,读者可以了解连接组学如何从果蝇推进到脊椎动物。
论文提出 Repo-To-Skill 与技能驱动的智能体 DisCo,将 GitHub 仓库中的操作性知识蒸馏为可复用技能,分为任务无关和任务导向两种形式。任务无关蒸馏产出 AREX-Skill Library,从 1,000 个常用 ML 仓库蒸馏出 5,000+ 个经核验的技能,按 20 个领域、178 个能力族组织。
SolarWM 是一个全开源的交互式视频世界模型基础,包含可重构多源数据引擎和骨干原生适配框架,将10个数据集约143万片段(约25.85TB)转为统一的帧对齐训练契约,并基于 Wan2.2、LTX-2.5 和 MiniMax-H3 训练四个 5B–33B 模型。
论文提出 Iris-mini 和 Iris-pro 两个搜索智能体,分别以 35B-A3B 和 397B-A17B 规模训练,并公开其数据管线与训练配方。任务从网页超链接结构反向构造多跳问题,经轨迹级与轮次级过滤后 SFT,再用 SFT-RL climbing 交替优化。
论文提出 Harness-of-Harness(HoH)框架,让基于 LLM 的编码智能体在无人工干预的自主开发中持续改进软件。HoH 运行在现有 coding-agent harness 之上,将执行组织为规划-编码-测试的迭代循环,平衡修复与能力增长,并把开发拆成小而可验证的增量。
DreamX-Creator 1.0 是一个以 7B 生成器为核心的原生音视频联合生成系统,基于首帧和文本提示对音频与视频流联合去噪,通过 Gated Cross-Modal Attention 在网络后半段耦合两个模态。