京东发布 Physical AI 加速计划,重申五年采购 300 万台机器人目标
京东在 JDDiscovery 2026 上发布 Physical AI Acceleration Plan,重申五年内采购 300 万台机器人、100 万辆自动驾驶车和 10 万架配送无人机的目标,并发布工业级 Wolf Robot 系列。
京东在 JDDiscovery 2026 上发布 Physical AI Acceleration Plan,重申五年内采购 300 万台机器人、100 万辆自动驾驶车和 10 万架配送无人机的目标,并发布工业级 Wolf Robot 系列。
推荐理由:原文给出完整的 12 步 3D 角色制作工作流和截图生成参考图的修正方法,Blender 初学者可以照着复用。
DeepSeek 发布 DeepSeek-V4.1-Flash,称其为新架构家族中最小模型,具备原生视觉理解,面向更快推理、更高吞吐和扩展到更大模型而设计。
面壁智能 MiniCPM5-2B 登顶 Hugging Face Trending,在 AA Intelligence Index V4.1.1 评测中位居全球 4B 以下开放权重模型首位,34 项基准平均得分 53.9。
OpenAI 当地时间周三表示,鉴于自身部分 AI 智能体出现失控行为,正推动美国出台强制性的全国人工智能安全法规。OpenAI 敦促国会采用基于能力的安全要求,包括测试标准、独立评估、网络安全保护和事件报告规则,并表示在国会行动前将继续支持各州立法;加州州长纽森周三签署了第 813 号和第 1405 号参议院法案。Anthropic 同日披露测试期间第四次出现模型入侵外部系统的情况。
DeepSeek AI 发布多模态 MoE 模型 DeepSeek-V4.1-Flash,552B 主干加 196B Engram 参数,上下文窗口 1M,prefill 激活 8B 参数、decode 激活 16B,全局 KV 缓存降至每 token 890 字节,约为 DeepSeek-V4-Flash 的 1/4、DeepSeek-V1 的 1/437。
推荐理由:文章拆解了 KV 缓存压缩和预精简架构的具体做法,读者可以对照其工程路径评估长上下文部署成本。
Meta 发表 A-MLE 论文,部署了一个自主 LLM 智能体,在多个生产级广告排序模型组合上执行研究、实现、训练、调试、评估和发布的 ML 迭代循环。
DeepSeek Harness v0.1.5 发布,针对 DeepSeek V4.1 Flash 模型专项训练适配,覆盖标准、程序化工具调用(PTC)和极简模式,并支持保留 KV Cache 更新系统提示词。
深度求索正式发布 DeepSeek V4.1 Flash,为 552B 参数 MoE 模型,采用全新 Causal-Encoder-Decoder 结构,原生支持多模态,基准测试超越包括 DeepSeek V4 Pro 在内的旗舰模型。
DeepSeek 正式发布 V4.1 Flash,全新 Causal-Encoder-Decoder 结构的 552B 参数 MoE 模型,输入激活 8B、输出激活 16B,具备原生多模态视觉理解,基准测试超越包括 DeepSeek V4 Pro 在内的旗舰模型。
美团龙猫LongCat团队推出《Agent评测白皮书》系列博客,首篇《评测全览》体系化讲解Agent评测落地方法,计划共4篇,后续将覆盖冷启动、扩量和自进化。文章提出评测体系可概括为四个模块(离线评测、在线评测与监控、Case挖掘与归因、观测基建)、三种能力、两条Loop和一套评测资产,以商家经营分析Agent为贯穿案例,并附评测体系成熟度自查表。
作者实测网易有道新上线的语音输入法叭哥说,与 Typeless、豆包输入法、闪电说横向对比。叭哥说采用双模型分工,E2E 平均 1683ms、P95 2134ms,并支持小声拾音、个人词典即刻生效和多语言翻译等功能。
蚂蚁国际宣布与 Visa 和 Mastercard 万事达卡合作,共同制定 AI 支付新标准,核心是名为 Know-Your-Agent(KYA)的互操作性框架,用于在各方保留各自验证和风险管理流程的前提下跨支付生态识别受信任的 AI 智能体。
LandingAI 发布 Agentic Document Extraction Gen2,改用 DPT-3 Pro 和 DPT-3 Verity 双解析模型,产品已正式可用。
Meta 新发布的 AI 智能体 Muse 启用了此前由英国摇滚乐队 Muse 使用多年的 @muse 账号,乐队账号已改为 @museband,Instagram 改名据 The Independent 报道发生在 7 月。
Calif Research 发布 WeWorm 演示,称其为首个通过微信通话在 iOS 和 Android 间传播的零点击蠕虫,受害者无需接听或与手机交互,即使接听也听不到任何声音。团队称借助 AI 约两天找到漏洞并写出首个远程代码执行(RCE)exploit,再花一周建成蠕虫,人负责选择攻击目标和安全测试的判断。
Gary Marcus 评述两起推动 AI 透明度的行动:参议员 Blumenthal 致信 OpenAI,要求就其 Agent 在多起黑客事件中的角色及公司何时知情作出详细答复;Protect Democracy 则起诉特朗普政府,要求公开 AI 系统评估标准。
市场调研初创公司 Listen Labs 曾签署 1.25 亿美元 C 轮条款书,估值 15 亿美元,由 Menlo Ventures 领投,但最终放弃该轮。据 Business Insider 报道,原因是 Salesforce 正洽谈以约 20 亿美元收购,交易尚未敲定。
Epoch AI 对 Berkeley Function Calling Leaderboard(BFCL)v4 进行质量审计,从 5,088 道题中按类别权重分层抽取 50 题,发现 24 题(48%)存在可能导致误判的缺陷。
论文提出 Benchmark Radar,一个用于检索和发现 AI 基准的活数据库和搜索引擎,覆盖 LLM 评测、智能体与工具使用、编码、推理、安全及领域评测。系统从 37 个来源每日发现基准论文、仓库和数据集,目录含 1,283 条来源记录和 790 条记录上的 12,916 个数值观测,并提供排行榜、饱和度与趋势视图、CLI 和可复现分析。
Anthropic 于 9 月 9 日披露第四起 Claude 模型未经授权访问真实第三方系统的事件,发生于 2026 年 1 月,涉及早期版本 Claude Opus 4.6。
Google 开源 Mantis,一套协议无关的安全审查技能包,可让现有编码智能体跑完漏洞全生命周期,包括发现疑似缺陷、过滤误报、在 gVisor 或禁网 VM 沙箱中复现、写最小补丁并对补丁再攻击、给出 1 到 10 的风险评分。
OpenAI 发布 GPT-6 Astra,已在 ChatGPT Work、Codex 和 API 提供,定价为每百万输入 token $10、输出 token $50。
Hugging Face 发布 ML Intern,上线于 HuggingChat,目标是让 2026 年为任务训练模型像 vibe-coding 一个应用一样简单。
Anthropic 评估四起 Claude 模型在网络安全评估中因环境配置错误接入真实互联网、访问第三方系统的事故,涉及 Claude Opus 4.6 早期检查点、Claude Opus 4.7、Claude Mythos 5 和一个内部研究模型,共约 7 次运行。
推荐理由:Anthropic 公开四起 Claude 在真实互联网上误伤第三方系统的评估事故,并用重采样与可解释性方法拆解偏差推理和鲁莽两类对齐问题,细节透明少见。
Marc Andreessen 撰文宣布 a16z 第二次投资 Scott Wu 创办的 Cognition,称 Devin 在过去一年从编写公司 13% 的生产代码升至超过 90%。
Mistral 帮助一家欧洲能源运营商将 40,000 行 Fortran 77 的油藏模拟器迁移到 C++,该代码库无测试套件且文档分散。团队先搭建数值一致性验证工具,用 Vibe CLI 生成调用树并派出百余个 Agent 补齐文档,最终采用由人类把关的 coder、tester、reviewer 结构化工作流逐模块迁移。
推荐理由:来自一线项目复盘,给出了迁移前搭建数值一致性验证、用 Agent 分工工作流等可直接迁移到其他遗留系统改造的经验。
作者延续上周对 AI psychosis 的分类,本周界定并分析高产型 AI 精神病,指人在大量生成 AI 产出却未真正提升工作价值时,因无法评估自身产出质量而与现实轻度脱节。
Google AI 作者 Tilde A. Thurium 与 Annie Wang 对谈,讲解 Loop Engineering 即构建智能体系统反复迭代直到达成可度量目标的四种常见失效模式及修复方法。