从预测到自主决策:预测分析如何进入 agentic AI 时代
企业 AI 的竞争前沿已从预测转向自主决策,核心问题变成如何让预测系统在不偏离业务意图的前提下自行采取行动。深度学习与生成式 AI 驱动的智能分析支持实时训练,使 AI 持续演进而无需等待季度刷新;其依赖的数据也从规整的数值记录扩展到非结构化来源。Everest Group 合伙人 Vishal Gupta 称,企业已不再满足于回望式视角,而「analytics」一词正让位于 AI。
企业 AI 的竞争前沿已从预测转向自主决策,核心问题变成如何让预测系统在不偏离业务意图的前提下自行采取行动。深度学习与生成式 AI 驱动的智能分析支持实时训练,使 AI 持续演进而无需等待季度刷新;其依赖的数据也从规整的数值记录扩展到非结构化来源。Everest Group 合伙人 Vishal Gupta 称,企业已不再满足于回望式视角,而「analytics」一词正让位于 AI。
MIT Technology Review 报告指出,企业 AI 正从工具转向「智能体式转变」的运营模式,全球 AI 投资 2026 年将达 2.5 万亿美元,同比增长 44%。报告认为企业 AI 的扩展瓶颈是结构性的,流程优先的公司正在领先,数据就绪而非数据规模才是 AI 产生复利效应的关键。报告建议重建数据基础设施、采用可组合架构,并解决 AI 主权问题。
Airbnb CTO Ahmad Al-Dahle 披露公司 AI 转型进展:目前 60% 的代码由 AI 编写,功能交付量同比增长近 80%,工程师人均 PR 吞吐量提升约 1.6 倍,约一半客服工单已完全由 AI 解决。
HPE 提出,当 AI 从试验走向客服、IT、研究与业务流程等常驻智能体工作负载后,按 token 逐次消费的模式会让支出难以预测,企业需按自身工作负载测算「自持容量」的盈亏平衡点。
Columbia Business School 报告《Financing the AI Buildout》测算 2025 至 2032 年美国新增 182.7 GW 数据中心容量的收入要求。
Anthropic 负责 Claude 微调的工程师 Jackson Kernion 解释称,后续模型优化重点放在数学和代码上,且接受了大量面向其他 AI 模型撰写技术解释的训练,导致模型形成适应 LLM 心理的「Claude 腔」,学会写给 AI 看而非写给人看。
Anthropic 负责 Claude 微调的员工 Jackson Kernion 解释,Opus 4.6 之后 Claude 写作变差,部分原因是新模型针对数学和代码优化,并在训练中学会写给 AI 看的技术性表达,产生被人类读者视为信息过密的“Claudeish”文风。
Nathan Lambert 发布与 Epoch AI 的 @datagenproc 的播客,双方最大分歧在于蒸馏对中国实验室的影响。
Nathan Lambert 在 Interconnects 播客中与 Epoch AI Insights 团队负责人 Jean-Stanislas(JS)Denain 讨论 AI 加速议题。
作者 Brandon Thomas 提出 Spymark 一词,指嵌入媒体、可在用户不知情下追踪来源的隐性信号,以区别于传统可见水印。他以 Google SynthID 为例,其 SynthID-O 可在 512x512 图像中编码 136-bit 载荷,足以容纳 64-bit 数据库标识符加纠错位;音频、文本同样可被嵌入追踪信号,且部分可抗压缩与编辑。
Latent Space 发布对 TypeSafe AI CEO Diogo Almeida 的约两小时访谈,围绕其新模型 Jev 展开。
《纽约时报》在诉 OpenAI 和 Microsoft 的版权案中提交法律简报,请求简易判决,其中引用被告内部文件称 AI 抓取是“人类历史上最大规模的劳动窃取”,OpenAI ChatGPT 负责人称 ChatGPT 对出版商是“生存威胁”。
SemiAnalysis 分析 Engram 架构(在标准 token 嵌入上扩展学习式多 token 查找)如何通过协同设计将嵌入表卸载到主存 DRAM 或 SSD,在同等质量下降低模型所需的 HBM 容量。
美光 CEO 高级顾问苏米特·萨达纳在 Six Five Summit 2026 上表示,内存短缺已覆盖所有市场,真正有意义的新增供应要到 2028 年才开始爬坡,供需何时平衡看不到明确时间。
Figure 的 Helix 2.5 端到端机器人模型在 30 户未见家庭中将零样本家庭任务成功率提升逾六倍,从 9% 升至 56%,且要求整个任务完成、无部分得分。
Anthropic 发布一套测量前沿 AI 开发节奏的指标,覆盖 AI 主导研发、智能体监督和算力分配三方面。
推荐理由:Anthropic 公开测量自身 AI 研发自动化程度、智能体监督和算力分配的方法与数据,读者可以看到前沿实验室透明度报告的一种可复用范式。
新闻集团在诉讼动议中指责 Microsoft 将为 Bing 购买的数据集转售给 OpenAI 作训练数据,且 OpenAI 从受商业限制协议约束的第三方获取含 180 万篇文章的 NYT 数据集并用于训练。原告方引用微软内部文件承认生成式 AI 对训练数据生产者就业存在"真实风险",并主张法院若认定抓取新闻不属于合理使用,可打破各 AI 公司竞相免费搭车的"囚徒困境"。
Tomer Tunguz 撰文分析 Berkeley 本周发表的 HarnessTax 研究:控制 AI Agent 的 harness 系统可在不损失准确率的情况下,将同一结果的成本降低 71%(GPT-5.6 Sol 从 Claude Code 换到 Pi,每解决一个任务成本从 $1.540 降至 $0.441)。
TrendForce 集邦咨询发布 AI Server 产业研究,预估 2026 年全球数据中心电力需求容量达 161GW,同比增长约 31%,其中 AI Server 占 33.4%。报告预计 2027 年增速仍超 30%,2030 年需求达 490.7GW,而电网可供容量仅 222.6GW,账面缺口 268GW,其中包含表后自建发电未被计入及并网交付延期两部分因素。
404 Media 披露 OpenAI 内部代号为莉莉计划(Project Lily)的项目,由时薪超 50 美元的提示词审核员查看匿名化后的真实用户聊天记录,评判回复是否切题、是否存在 AI 式话术和谄媚口吻。
推荐理由:报道披露了人工审核流程的运作细节和隐私边界,读者可以据此了解模型优化背后的人力环节与数据风险。
Dwarkesh Patel 与 Zyphra CTO Beren Millidge、Thinking Machines 首席科学家 John Schulman、Baseten 模型训练负责人 Charlie O'Neill 三位研究者对谈递归自我改进(RSI)的前景。
推荐理由:三位一线研究者就递归自我改进的技术瓶颈、蒸馏与RL环境壁垒、参数规模趋势给出具体分歧和可检验预测。
Nathan Lambert 发布一份开放模型领域精选阅读清单,涵盖基础概念、中美竞争与技术细节三部分。
继 NYU 教授 Tristan Buckmaster 公开质疑后,数学家 Andreas Thom 在 Mastodon 指控 OpenAI 不透明且不诚实,担心他与同事和 ChatGPT 的互动可能进入了训练数据,并促成 OpenAI 上月宣布的 10 项结果之一,该非 sofia 群结果大量依赖 Thom 和 Gábor Kun 的先前工作。
Ramp 汇总 70,000 家公司的支出数据发现,8 月支付 AI 产品的客户占 56%,环比仅增长 0.4%,样本中头部 1% 企业的人均 AI 支出下降近 10% 至 $7,205。
Anthropic 经济团队基于技术报告《Economic Scenarios for Transformative AI》发布交互式经济情景探索工具,把经济表示为任务束,推演 AI 到 2030 年对美国经济的影响。
推荐理由:原文给出模型化的三种经济情景和关键数字,读者可以据此理解AI对不同职业工资和就业的可能影响。
Jensen Huang 在接受 Axios 采访时回应“开源模型公司是否应被允许蒸馏闭源模型”,称从 AI 和他人知识中学习是智能的基础,更聪明的 AI 也可以是更安全的 AI。
数学家 Tristan Buckmaster 公开发声,称 OpenAI 在其与 Levent Alpöge 借助 Claude 和 Codex 运行 GPT-5.6 Sol 在 Navier-Stokes 方程上取得进展后对其施压。
Simon Willison 转述 Konstantin Ryabitsev 的观察:git.kernel.org 为应付滥用爬虫的“背景辐射”,在 5 个地理分布节点上常年有 14 个 CPU 核心专门把 git 提交渲染成 HTML,CPU 开销超过包括 git clone 在内的所有合法访问。Willison 担忧这对提供大量可爬网页的 Datasette 也有影响。
Charlie O'Neill 撰文指出,宣称一切将是 RL 环境的人很少按该信念做出理性行动,如同当年 scaling 和 AGI 信奉者并不真下注。他提出无论 RSI 是否成立都应造高价值数据与环境:若 RSI 成立,单位效用环境价值将指数增长,值得在实验室内做最有针对性、可累积的环境;若不成立,实验室需要模型在所有领域变强,会为有用数据支付高价。
《金融时报》9 月 2 日报道,达拉斯联邦储备银行研究发现,自 ChatGPT 发布以来,得克萨斯州受 AI 影响较高行业的招聘职位大幅减少,2025 年第一季度这类职位招聘减少约 8%,大学毕业生失业率升至异常高水平。
作者认为下一个令牌预测器只是对 LLM 的零阶近似,机制形态正确但不完整。现代后训练中的 RLVR 让模型通过自己探索生成的新序列并获得奖励来学习,类似会穷尽探索的象棋引擎而非模仿大师棋谱的下一步预测器,因此 RLHF 和 RLVR 编码的内容早已超出对现有文本的预测。
a16z Charts 汇总近期数据指出,自 2025 年 1 月以来科技招聘明显更偏好工作年限(约 5-10% 变化)而减少对技能数量的要求,作者认为这与 AI 带来的技能空白有关。