Google 团队在 TPU 上用 MaxText 复现 Ai2 的 Olmo 3 7B 预训练
Google 团队用 MaxText 在 Google Cloud TPU 上从头复现 Ai2 的 Olmo 3 7B,完成 stage-1 预训练(约5.93T token。
Google 团队用 MaxText 在 Google Cloud TPU 上从头复现 Ai2 的 Olmo 3 7B,完成 stage-1 预训练(约5.93T token。
NVIDIA 与 Google DeepMind、EMBL-EBI 等全球研究机构合作,通过 AlphaFold Database 开放发布 2800 多种病毒的蛋白复合物预测 3D 结构,旨在为下一次疫情储备知识。
推荐理由:原文给出数据集规模、覆盖范围和可复用的开源预测流程,读者可以据此评估如何用于自己的蛋白结构研究。
论文提出 Just-in-Time Memory(JitMem),保留原始轨迹并把记忆整理推迟到读取时,由整理器根据当前任务合成任务自适应的紧凑载荷。在 ALFWorld、WebShop 和 τ^2-bench 上,JitMem 分别超过最强基线 16.2、16.3 和 3.9 个绝对成功率点,未训练的整理器也已与基线相当或更优。
上海AI实验室推出 InternW 物理世界模型系列的首个模型 InternW0,通过非对称视频动作架构结合 flow matching 联合学习未来视觉动态与连续机器人控制,视频专家提供长时程预测上下文,轻量动作专家以更快频率运行,并通过复用层间 K/V 和观察条件上下文路由避免每次动作更新都重新生成未来。
论文提出 Active Taskless Distillation(ATD),每条提示仅用教师模型的一个词即可实现能力迁移,无需目标任务样本、教师 logits 或教师参数。
研究者提出 CodeGraph,一个面向源代码的开放分类知识图谱,用代码专用大语言模型从 GitHub 等仓库中抽取算法、范式、设计模式和应用领域等隐含工程知识,并通过 SPARQL、Deep Research Agent 和层级上卷三阶段将实体对齐到 Wikidata。
Anthropic 宣布其湾区湿生物实验室借助 Claude 发现一个此前未知的酶系统,藏在噬菌体 DNA 中,能执行切割、复制、粘贴 DNA 等操作,性质令人联想到 CRISPR。
Baseten Base Labs 用 Qwen3 0.6B/1.7B/4B/8B 在 16 个推理任务上比较 GRPO 直接训练与先用 gpt-5.6-sol 教师解法做 SFT 再 RL。
Anthropic 宣布成立生命科学研究组与实验室,Claude 智能体在仅有人类高层指导下自主发现一种与 DNA 重复序列相关、结构类似 CRISPR 的新型酶系统,命名为 array-associated reverse transcriptases(ART),并发布预印本。
推荐理由:原文给出 Claude 发现新酶系统的具体过程与规模数据,读者可了解 AI 智能体如何参与基础生物学发现的工作方式。
Anthropic 称其湿实验室的首个成果中,Claude 自主发现了一个新酶系统,并类比 Crispr 背后的基因编辑机制。约 950 个 Claude 智能体在 21 小时内处理 2.1 亿 token,从大规模 DNA 序列数据库中标记出异常重复模式,经人类科学家分析和实验确认为噬菌体中此前未被表征的酶系统。
Anthropic 负责 Claude 微调的工程师 Jackson Kernion 解释称,后续模型优化重点放在数学和代码上,且接受了大量面向其他 AI 模型撰写技术解释的训练,导致模型形成适应 LLM 心理的「Claude 腔」,学会写给 AI 看而非写给人看。
Anthropic 负责 Claude 微调的员工 Jackson Kernion 解释,Opus 4.6 之后 Claude 写作变差,部分原因是新模型针对数学和代码优化,并在训练中学会写给 AI 看的技术性表达,产生被人类读者视为信息过密的“Claudeish”文风。
Basecamp Research 获 1.4 亿美元融资,投资方包括 S32、Nvidia、Anthropic 的 Anthology Fund 和 NATO Innovation Fund,用于开发生物 AI 模型 EDEN 并推进体内细胞疗法进入临床。
研究者在将 Qwen3-4B 和 Qwen3-8B 蒸馏到 Qwen3-1.7B-Base 时发现,潜在监督会让 MATH-500 准确率在 10 步内从 25 升到 46,随后却崩到 11 且无法恢复,而对齐指标仍在持续改善。
论文提出用证明长度与陈述长度之比衡量定理的内在有趣度,并证明其与下游实用性相关。作者训练了一个 27B 模型预测证明难度,准确率超过前沿通用模型;按该指标优化后,生成定理与 Mathlib 的实质性或完全重合率从 91.9% 降至 30.6%,系统可迭代构建自扩展的机器验证数学库。
Snorkel AI 完成 3.5 亿美元 E 轮融资,由 Insight Partners 和 S32 领投,估值 35 亿美元,约为 17 个月前 D 轮 13 亿美元估值的近三倍。公司称年化收入达 3.75 亿美元,过去 12 个月增长 18 倍,主要来自 AI 实验室对高端训练数据的需求;其 RL 环境和数据集业务中支付给人类专家的费用计入成本,而非总年化收入。
Nathan Lambert 发布与 Epoch AI 的 @datagenproc 的播客,双方最大分歧在于蒸馏对中国实验室的影响。
Nathan Lambert 在 Interconnects 播客中与 Epoch AI Insights 团队负责人 Jean-Stanislas(JS)Denain 讨论 AI 加速议题。
404 Media 调查发现,多名受雇改进 OpenAI 模型的外包承包商因用 AI 生成内容来完成训练工作被解雇。这些承包商负责阅读真实 ChatGPT 用户的提示词等数据以改进模型回答;有承包商称此类违规“随时有人在犯,也随时有人因此被开除”,作者指出 AI 生成文本回流训练可能加剧“模型坍塌”问题。
小米发布 MiMo-V2.6 系列,旗舰 MiMo-V2.6-Pro 在 Artificial Analysis Intelligence Index 得 46 分,居开源模型之首,价格为每百万输入 token $0.435、输出 $0.87。
小米发布 MiMo-V2.6 系列,包含原生全模态模型 MiMo-V2.6-Pro 与 MiMo-V2.6-Flash,并推出输出速度最高提升 20 倍的 MiMo-V2.6-Pro-UltraSpeed。
推荐理由:小米以约 300 万美元训练成本推出原生全模态开源模型,并公开 RL 环境与训练配方,可对照中国开源模型的成本路线。
2026 云栖大会上,阿里巴巴 CEO 吴泳铭表示客户 AI 需求强劲,将全力投入 AI 基础设施建设,目标到 2032 年阿里云运营的全球数据中心规模超过 20GW。他指出 AI 模型、AI 芯片和 AI 云是机器智能时代三大基石,董事会主席蔡崇信透露阿里正搭建覆盖芯片、云、模型服务、智能体应用的五层协同架构,并计划训练一款参数量为 5 万亿至 10 万亿的 AI 模型。
作者 Brandon Thomas 提出 Spymark 一词,指嵌入媒体、可在用户不知情下追踪来源的隐性信号,以区别于传统可见水印。他以 Google SynthID 为例,其 SynthID-O 可在 512x512 图像中编码 136-bit 载荷,足以容纳 64-bit 数据库标识符加纠错位;音频、文本同样可被嵌入追踪信号,且部分可抗压缩与编辑。
Meta 发布 A-MLE(Agentic ML Exploration),一个已在自家广告排序模型上部署的 LLM 智能体框架,自动化提出想法、跑实验、恢复失败任务、比较结果并在模型间迁移经验。
Latent Space 发布对 TypeSafe AI CEO Diogo Almeida 的约两小时访谈,围绕其新模型 Jev 展开。
MIT Technology Review 与 Times of San Diego 用 15 个月调查,绘制出美墨边境监控塔附近死亡的首张综合地图与分析。
研究者提出 Priority-Constrained Descent(PCD),一种显式利用目标层级结构的梯度优化框架,在保持主目标下降方向的同时,以最小失真保证次目标(如稀疏、压缩、鲁棒性)的进展,失真强度由单一参数 τ∈[0,1] 控制。
该研究指出标准位置编码无法确定文本的层级结构。作者使用分层旋转位置编码(hRoPE),通过干预段落坐标并测量跨段落注意力,发现真实结构表现为更深的注意力压缩,且这种压缩深度具有语料依赖性。相比之下,随机标签的控制组虽然也有压缩,但深度较浅且不具语料依赖性。研究表明,压缩深度而非其位置,是识别真实段落结构的可靠特征。
研究发现,在个性化大语言模型中,显式的风格指令可能会破坏用户特定的特征(即“个性化崩溃”)。为此提出 PsPLUG,一种轻量级插件,通过学习扣除请求风格后的用户特定残差来平衡两者。实验表明,PsPLUG 能在提供精确风格控制的同时,更好地保留用户偏好。
CARD提出一种分层框架,通过聚类用户风格模式并学习组特定LoRA适配器实现可扩展的个性化。其核心机制包括隐式偏好学习(对比用户文本与组生成结果)以及推理时仅通过轻量级用户偏好向量和低秩logit校正注入个性化,保持基础模型冻结。实验显示其在LaMP基准上优于基线,同时提升了效率与可扩展性。
《纽约时报》在诉 OpenAI 和 Microsoft 的版权案中提交法律简报,请求简易判决,其中引用被告内部文件称 AI 抓取是“人类历史上最大规模的劳动窃取”,OpenAI ChatGPT 负责人称 ChatGPT 对出版商是“生存威胁”。
作者 nandakishor_ml 发布开源非自回归决策模型家族 Laya,基于双向编码器,单 GPU 推理 32.8 ms(批量 7.2 ms/问题),自称比 TypeSafe AI 的 Jev 快 7.8 倍,权重以 Apache 2.0 开源。
Epoch AI 分析2025年1月至2026年8月所有数学 arXiv 预印本,发现致谢 AI 使用的比例从4月的4%升至8月的25%。方法是用 AI 关键词筛选后由 GPT-5.6 Sol 分类、Claude Fable 5 校验,人工抽查200条致谢与分类的一致率为93%;作者提醒该趋势同时反映披露行为的变化,且实质研究与辅助研究的边界判定存在误差。
SemiAnalysis 分析 Engram 架构(在标准 token 嵌入上扩展学习式多 token 查找)如何通过协同设计将嵌入表卸载到主存 DRAM 或 SSD,在同等质量下降低模型所需的 HBM 容量。
北京市经济和信息化局9月18日发布“词元经济十条”,即《北京市加快词元经济发展的行动方案(2026—2028年)》。方案提出高标准建设词元工厂,制定覆盖模型适配数量、词元吞吐速度、首字延迟、缓存命中率、PUE 等指标的分级评价标准;推动推理专用芯片、模型轻量化、边缘端部署等技术攻关;并部署词元质量评测体系、词元分发平台、通用与垂直领域智能体培育、算力与词元金融工具及词元工程师再技能化培训等措施。