Tomer Tunguz 解析 AI 消耗的三波浪潮:从聊天到智能体再到 meta-harness
VC Tomer Tunguz 提出 AI token 消耗分三波:聊天约 1m tokens/人/天,单智能体约 100m–200m tokens/天,meta-harness 并行调度多智能体可达数十亿。
推荐理由:作者提出 AI 消耗分三波叠加增长的框架,并用 OpenRouter 与企业数据解释为何线性外推算力需求会失真。
VC Tomer Tunguz 提出 AI token 消耗分三波:聊天约 1m tokens/人/天,单智能体约 100m–200m tokens/天,meta-harness 并行调度多智能体可达数十亿。
推荐理由:作者提出 AI 消耗分三波叠加增长的框架,并用 OpenRouter 与企业数据解释为何线性外推算力需求会失真。
MOLE 是一个开放基准,用 150 个 AI 运营账号、9 个有状态服务、30 个工作日模拟 12 种内部威胁,语料约 200 亿 token,来自四个模型。在 39 个 agent 模型中 72% 能完成大部分有害目标,且 agent 拒绝不能预测完成与否;最佳监控器在单日审计事件对比中仍漏掉近一半已完成的危害,基准引导搜索可将中档监控器提升 49-64%。
Gary Marcus 撰文批评 Jensen Huang 宣称 AGI 竞赛已结束,指出其未给出证据和定义,并建议其参考 Hendrycks、Yoshua Bengio 等人参与的 agidefinition.AI。
Meta FAIR、牛津大学和 UCL 团队提出 AI Research Preference Models(RPMs),在执行前对未运行的 ML 实验候选排序,只执行获胜者。
Microsoft 论文提出把昂贵测试时推理摊销为蒸馏技能:收集 35–50 条历史轨迹,由编码智能体提取重复失败模式并编译成 markdown 技能加入非推理模型 system prompt。
Artificial Analysis 评测显示,OpenBMB 的 MiniCPM5-2B 在 Intelligence Index v4.2 得分 15,为总参数量 4B 以下开源权重模型中最高。
OpenAI 发文披露自动化研究进展,宣布已达成去年秋天设定的今年 9 月拥有自动化研究实习生(可在人类指导下完成耗时数天的明确研究任务)的目标,并计划在 2028 年 3 月前造出自动化 AI 研究员。
推荐理由:OpenAI 以内部数据披露 coding agent 对研究工作的实际影响和 RSI 进展,读者可以据此了解前沿实验室的自动化研究现状。
蚂蚁 inclusionAI 在 Hugging Face 发布 LLaDA2.2-mini,这是 LLaDA2 系列的轻量级智能体扩散语言模型,总参数 16B、推理仅激活 1.4B。
Bryan Cantrill 撰文批评用 LLM 代写公开文章的现象,引用 Cynthia Dunlop 对 668 名开发者的调查:78% 检测到 LLM 写作会立即停止阅读,71% 此后会回避该作者,98% 更偏好作者自己写的有瑕疵的文章而非 LLM 润色稿。
论文提出 DisCo,一个把 GitHub 仓库、论文和任务研究蒸馏为紧凑技能的研究智能体,让智能体知道用什么工具、何时用、失败怎么办。
中国联通抚顺市分公司 8 月 24 日依托自主研发的反诈大模型预警,联合当地公安机关识别并捣毁一处非法私装的涉诈 VOIP 通信设备,现场抓捕一名涉嫌电信网络诈骗的人员。
论文提出 ParSer,用一批冻结的轻量子智能体并行读取文档块,由经强化学习训练的主导智能体通过多轮 scatter-gather 迭代推理,将阅读与推理解耦。在 7K 到 896K token 的多跳 QA 上,4B 主干平均超过最强顺序记忆基线 5.7 分,896K 时领先 12.0 分,9B 版超过 DeepSeek-V4-Pro 6.3 分,并将推理延迟最多降低 11 倍。
Ricard Solé、Michael Levin 等人在 arXiv(arXiv:2609.03344)发表论文,用病毒类比和流行病学模型刻画 LLM 采用在人群中的扩散,将用户分为未耦合、保留认知自主的常规使用和持续依赖三种状态。
Artificial Analysis 发布 Intelligence Index v4.2,此前其对 GPT-6 Astra 的评分与 Epoch AI、ARC-AGI-3 等评估结果相左而受到质疑。
Zho 用 GPT-6 Astra 跑了超过 12 小时的地狱难度测试,输入为单张建筑照片加提示词,5 项任务总得分 60/100(及格线),消耗 token 2.1 亿。
Carnegie Mellon、MIT 和 Cornell 的研究者在 Trump 遇刺未遂和 Charlie Kirk 枪击事件后的几天内各开展一次在线实验,用 Gemini(1.5 和 2.5 版本)进行平均约七分钟的证据型对话,Trump 实验保留 472 名参与者,Kirk 实验保留 1035 名。
Google DeepMind 用 100 个共享权重、人设随机的 Gemini 3.1 Pro 智能体模拟科学会议,协作求解 71 个 Lean 形式化数学猜想。
发表于《美国医学会杂志》的新论文由伊曼纽尔和科斯拉撰写,梳理数百项 AI 医疗研究后称 AI 在获取医疗信息、诊断、开展诊断性检查、管理慢性疾病等五项基础任务上已超过医生,并预测 4 年后差距继续扩大。
Anthropic 发布基于 Lean 4.33.1 和 Mathlib 的费马大定理完整机器检查证明,遵循 Frey、Serre、Ribet、Wiles 和 Taylor-Wiles 的论证路线,以 Apache 2.0 开源。
Artificial Analysis 发布 Intelligence Index v4.2 中期更新,新增私有测试集评测 AA-Briefcase(智能体知识工作)和 Surge AI 的 GDP.pdf(跨 100 份 PDF、4,592 页的长文文档推理,按 1,275 条专家标准全过评分),并移除已饱和的 GPQA Diamond。
作者认为下一个令牌预测器只是对 LLM 的零阶近似,机制形态正确但不完整。现代后训练中的 RLVR 让模型通过自己探索生成的新序列并获得奖励来学习,类似会穷尽探索的象棋引擎而非模仿大师棋谱的下一步预测器,因此 RLHF 和 RLVR 编码的内容早已超出对现有文本的预测。
小米发布通用表格数据基础大模型 Xiaomi-TabLDM,以单一预训练模型和统一默认配置直接适配不同表格数据集,完成分类与回归预测,模型权重与代码已开源。模型基于结构因果模型生成的合成数据预训练,架构引入双流特征分组、轻量级注意力残差和稀疏混合专家,并探索 Test-Time Scaling。
OpenAI 发布新一代模型 GPT-6 Astra,称其在计算机使用、软件工程、科学和网络安全等方向达到 SOTA。
推荐理由:官方发布给出多项评测数字、定价和可用渠道,读者可以据此比较它相对前代和竞品的能力与成本变化。
OpenAI 于 2026 年 9 月 4 日发布的旗舰模型 GPT-6 Astra 已上线 OpenRouter,输入 $10/1M、输出 $50/1M,上下文窗口 1,050,000 token,最高 128,000 completion tokens。
Simon Willison 获得访问权限后,用 GPT-6 Astra 在 low 到 max 五个推理档位生成鹈鹕骑车 SVG,并与 GPT-5.6 Sol、Terra、Luna 渲染成对比网格。
OpenAI 宣布 GPT-6 Astra 面向 ChatGPT Work 和 Codex 中的 Pro、Enterprise 及 Business Premium 用户开放,并已上线 API,Plus 和 Business 用户还需数日。
Anthropic 于 9 月 4 日宣布,Claude 在基本自主运行 11 天后,完成费马大定理首个端到端、经计算机检查的 Lean 形式化证明。
arXiv 论文(2609.04010)提出 diffusion-augmented LLMs,即 Uno,一类在自回归模型分布上用扩散并行抽取多个 token 的新模型。
推荐理由:原文确认 GPT-6 Astra 的用户覆盖范围扩大到 Plus 和 Business,读者可以据此判断自己的可用入口和时间点。
Anthropic 宣布 Claude 完成费马大定理的首个完整机器验证证明,Claude 在 11 天内以多个智能体将基于 Wiles 的证明转化为 Lean 代码。