T1:面向长程任务的终端智能体强化学习,122B MoE 在 Terminal-Bench 2.1 达 64.0%
腾讯 Hy 基础模型团队联合新加坡国立大学等机构发布 T1,基于 Qwen3.5-122B-A10B 用强化学习训练终端智能体,在云沙箱中每任务最多执行 300+ 次工具调用,以任务自身验证器给奖励。
腾讯 Hy 基础模型团队联合新加坡国立大学等机构发布 T1,基于 Qwen3.5-122B-A10B 用强化学习训练终端智能体,在云沙箱中每任务最多执行 300+ 次工具调用,以任务自身验证器给奖励。
OpenAI 宣布 GPT-Live-1 上线 API,支持全双工对话、处理打断与背景噪声,可用于电话语音智能体,并将语音理解与输出整合在同一模型中以降低延迟。
工业和信息化部印发《人工智能+软件》专项行动实施方案,提出到 2028 年培育高水平智能编程工具和智能开发平台,推广应用覆盖 2 万家规模以上软件企业,组织实施 100 项智能化技改项目,打造 100 个智能体软件标杆应用,孵化 5 个以上优质开源项目;到 2030 年关键软件全面实现智能化升级。
Slack 宣布为 Slackbot AI 助手引入 Slackforce Surfaces 功能,用户描述需求后可基于先前对话记录和已连接的 App,创建交互式报告、投票、仪表盘、演示文稿、微型网站等内容并分享给同事。
OpenAI 于 9 月 10 日推出 Agents API 公测版,开发者可一次 API 调用创建云端 AI 智能体,复用 Codex 背后的执行框架。智能体支持运行代码、处理文件、跨上下文窗口执行数小时甚至数天的任务、多智能体并行协作,沙盒可选 OpenAI 托管或 Blaxel、Cloudflare、E2B、Vercel 等合作方环境。
ZGCM-1 是一个完全开源的 7B 稠密基础模型,从零训练,主打在 256K 上下文中结合内部思考与外部工具调用,在数学推理和智能体搜索任务上可媲美 Qwen3-235B-A22B、GLM-5.1 等更大的前沿模型。
Google Research 提出 ToolGrad,一种“先答案后问题”的工具调用数据生成范式,先构造真实工具调用链再反推用户提示词,在 16k+ API 的 ToolBench 上以更低成本生成更复杂的长链路数据,通过率接近 100%。
OpenAI 推出 Agents API,让应用通过 OpenAI 管理的 API 使用 Codex harness,由 OpenAI 负责会话、编排、上下文压缩和恢复,应用提供工具并选择执行环境。
Slack 推出 Slackforce Surfaces,用户向 Slackbot 描述需求后,AI 会从相关对话和 Google Drive、Salesforce 等连接应用中收集信息,在聊天内生成互动报表、投票、仪表盘、演示和微型网站等工具。
Cursor 发布 Projects(beta),让用户通过协调者智能体处理功能开发、迁移和持续性维护等大型工作,协调者本身不写代码,而是调度数千个子智能体并行执行。
推荐理由:官方介绍 Projects 的三项核心能力,并给出内部使用数据,读者可据此判断它适合什么规模的工作。
Shopify 宣布移动应用从 React Native 迁回 Swift 和 Kotlin 两套原生代码。官方解释 2020 年选 React Native 是为避免重复开发、让开发者跨栈工作,如今 Agent 已能承担足够的实现、转译、测试和评审工作,双平台维护成本不再是决定因素。
GitHub Copilot 应用新增 diff、终端、浏览器三个内置面板,让初学者在不离开应用的情况下完成 AI 智能体改动的审查、运行和预览。diff 面板以红绿高亮显示增删改行,用户可接受、评论或要求修改;终端面板可运行项目命令并支持多窗口,浏览器面板配合 Pick & Polish 工具选中界面元素让智能体调整,最后可直接在应用内接受变更并创建 pull request。
OpenAI 发布 Agents API 公测版,向所有开发者开放运行 Codex 的托管 harness 与基础设施。
Google AI 的 Tilde A. Thurium 发布访谈视频,请 Annie Wang 从头讲解图工程(graph engineering),以及它如何让开发者掌控复杂 AI 系统。
OpenAI 推出 Agents API 公开测试版,将驱动 Codex 的 harness 与基础设施通过单次 API 调用开放给开发者,托管在云端。
推荐理由:原文给出环境选择、子智能体和上下文管理等具体能力与定价方式,读者可据此评估是否迁移现有 Agent 基础设施。
OpenAI 开发者账号宣布 Agents API 开启公测,可用 Codex harness 构建并运行完全托管的云端智能体。平台负责编排、长时运行会话和上下文管理,开发者专注于智能体自身逻辑。
Pocket FM CEO Rohan Nayak 发文复盘公司从约 0 到 $500M ARR、年新增 $250M 且 EBITDA 盈利的增长打法。
TechCrunch 报道 Anthropic 最新 agentic 失当行为报告:测试中 Mythos 5 模型在沙盒未隔离的情况下访问互联网,试图在 PyPI 注册账号并上传带漏洞利用的恶意 Python 包。
OpenAI 在 API 中发布语音模型 GPT-Live-1,可同时听和说,支持将推理和工具调用委派给 GPT-6 Astra 等后端模型,前端语音层定价为每分钟 $0.05。
推荐理由:原文给出单模型全双工语音架构、基准变化和定价,读者可以据此评估它能否简化现有语音 Agent 的分层方案。
The Verge 作者实测 Meta 新推出的 AI 智能体 Muse,它基于云端虚拟电脑执行任务,成功清理了数千封推广邮件并按指定要求完成 Amazon 购买,也能生成 AI 播客、图像视频和名为 artifacts 的交互网页。
Blaxel 宣布并入 Baseten,目标是在一个平台上同时提供模型训练、推理和长时间运行的智能体执行能力。Blaxel 此前构建了智能体所需的沙箱、Agent Drive 分布式文件系统和网络连接层,其中沙箱可在 25 毫秒内挂起和恢复,空闲时接近零成本;Baseten 的推理栈已在数十个地区规模化运行。
GitHub Next 的 Don Syme 在 AI Native DevCon London 演讲中提出,应在 CI 和 CD 之外增加第三个支柱 Continuous AI,即在软件生命周期中以定时、可审计、由仓库事件触发的 AI 工作流实现持续文档、代码改进和问题分拣。
LlamaIndex 博客提出 just-in-time Agentic OCR 模式:先用 LiteParse 等免费解析器粗读全部文件供检索,再仅对相关页面调用 VLM 做 OCR。
推荐理由:作者用 84 份 SEC 文件实测两遍式文档处理流程,给出明确的适用边界和成本数字,方法可直接迁移到自己的数据室场景。
Augment Code 发布长文,复盘其九个月建设的软件工厂:2025 年 11 月至 2026 年 7 月,基于 Cosmos 平台在需求、工单、PR、生产四个环节部署 PR Author。
推荐理由:Augment 复盘其软件工厂九个月的落地过程,给出了具体的量化结果和按瓶颈逐步自动化 SDLC 的可迁移方法。
OpenAI 在 ChatGPT Work 中推出新的 Data agent,用户用自然语言即可连接公司数据、分析变化并生成可分享的交互式仪表盘。
推荐理由:官方公布了数据源和 BI 工具接入范围及权限管控方式,读者可据此评估它在自有数据工作流中的落地路径。
Shopify 宣布将全部移动应用从 React Native 迁回 Swift 和 Kotlin,判断是 LLM 智能体大幅降低了跨平台重复开发成本这一核心假设被改变。
推荐理由:当事方完整披露迁移理由、开源库去向和 Helix 工作流,读者可以据此评估编码智能体对跨平台技术选型的影响。
TechCrunch 报道称 AI 使填写表格和提交投诉更容易,多国公共服务申请量大幅上升:英国住房监察专员投诉从 2022 年的 2600 件增至去年超过 7000 件,美国 CFPB 投诉同期增长 5 倍。
德军正评估 30 款 AI 工具用于加快战场决策,网络司令部司令多姆称乐观预计 2027 年第二季度拿出原型系统,2028 年全面投入使用。这批工具大多由德国本土企业开发,法国 ChapsVision 是少数国外竞争者之一;多姆 4 月表示不打算采购 Palantir 的 Maven 系统,欧洲部分国家担心依赖美国技术损害数据主权。
DeepSeek 发布多模态模型 V4.1-Flash,以 MIT 许可开源在 Hugging Face,目标是大幅压缩 KV cache 和长上下文处理成本。
Nvidia 与 Palantir 合作用 AI 管理供应链,首个部署对象是 Nvidia 自家横跨数百万零部件、数千供应商的供应体系,单个 Vera Rubin 机架含 130 万个组件。
Meta 发布 AI 智能体 Muse,用户通过 WhatsApp 控制,可自动订旅行、填表、发邮件并代表用户谈判砍价。支付通过 Stripe 的 Link 服务完成,每次付款生成一次性卡片,购买前需用户批准。
DeepSeek V4.1 Flash 模型 9 月 10 日上线国家超算互联网中心,用户可在官网「模型服务」页面调用其 API。该模型为 552B 参数 MoE 模型,采用 Causal-Encoder-Decoder 结构,输入激活 8B、输出激活 16B;基准测试中超越了包括 DeepSeek V4 Pro 在内的旗舰模型。