蚂蚁 inclusionAI 发布块扩散视觉语言 GUI 智能体 LLaDA-UI
蚂蚁 inclusionAI 在 Hugging Face 发布 LLaDA-UI,一个基于 MoE 的块扩散视觉语言 GUI 智能体,总参数约 16.7B,语言骨干为 LLaDA2.0-mini-base。
蚂蚁 inclusionAI 在 Hugging Face 发布 LLaDA-UI,一个基于 MoE 的块扩散视觉语言 GUI 智能体,总参数约 16.7B,语言骨干为 LLaDA2.0-mini-base。
蚂蚁 inclusionAI 在 Hugging Face 发布 LLaDA2.2-mini,这是 LLaDA2 系列的轻量级智能体扩散语言模型,总参数 16B、推理仅激活 1.4B。
推荐理由:OpenAI 首次系统说明对齐事故的披露思路,并预告将发布披露框架,读者可借此了解行业在事件报告上的走向。
百度智能云介绍与杭州加南科技的合作:F2 AR智能眼镜不配置摄像头,通过PPG心率、IMU、语音、位置与交互信号为AI提供用户上下文,心率偏离基线时可结合情境生成可确认或忽略的状态提示,并形成Heart Moment心情可视化功能。架构上终端负责感知与AR呈现,云端由百度智能云提供大模型、实时语音、翻译、百度地图与百舸、千帆等能力,形成端云协同的一体化方案。
百度智能云推出百度搭子教学套件,围绕教学场景提供教学方案设计、公开课设计、AI课程改造和知识图谱构建四项核心能力。老师提交课程资料后可唤起秒哒生成可交互的3D课件;AI课程改造从内容适配性、学生受益度等五个维度评估课程并提供16课时标准课程骨架;知识图谱支持六种概念关系识别,可输出交互式HTML和PNG。
OpenAI 发布新一代模型 GPT-6 Astra,称其在计算机使用、软件工程、科学和网络安全等方向达到 SOTA。
推荐理由:官方发布给出多项评测数字、定价和可用渠道,读者可以据此比较它相对前代和竞品的能力与成本变化。
OpenAI Developers 宣布 GPT-6 已发布,并将为开发者、技术创始人和产品建设者举办 GPT-6 黑客松:旧金山场为 9 月 8 日,纽约场为 9 月 10 日。
xAI 给 Grok Bot 开放供应商支出、合同和使用数据,搭建了名为 Haggle Bot 的采购智能体,已找出超过 10 万美元直接节省。SaaS 审计中发现一个产品有 43 个付费席位 90 天无活跃,节省 $14,220,另一个产品每年有 $85,662 未使用 SKU;办公用品比价一次将 $14,629 的订单压到 $6,143,降幅 58%。
推荐理由:原文公开了完整系统提示词与具体省钱数字,读者可以直接参考其意图表达和权限边界的搭建方式。
Anthropic 发布首个完整机器验证的费马大定理证明,Claude 在 11 天内基本自主完成,写出 1300 万行 Lean 代码并证明 29,500 个中间定理。
推荐理由:原文给出了耗时、代码量、平台与验证方式等细节,读者可以了解多智能体自动形式化复杂数学证明的实现路径。
Google AI 发布本周产品盘点。Gemini 3.8 Flash 在编码、Agent 工作流和多步推理上升级;Gemini 3.8 Flash Cyber 主打漏洞检测与自动补丁。
Databricks 官方博客介绍营销团队使用 Genie One 的五种方式,指出营销团队手头已有campaign 表现指标和客户数据等数据资产,可用 Genie One 加以利用。
Google Cloud 的 Gemini Enterprise 开发者体验(DevEx)计划本轮聚焦智能体治理,梳理出从配置受治理的智能体身份、注册 Agent Registry、绑定 Agent Gateway,到应用 IAM/IAP 与 Semantic Governance 策略、启用 Model Armor 并验证执行的五步端到端流程。
GitHub 推出 Project HydraFusion 研究预览,通过运行时多模型编排,在 Single、Cascade、Critique 三种执行模式间为每个任务选择工作流,以平衡质量、成本和延迟。
推荐理由:原文给出三种执行模式和三个基准的质量与成本数据,读者可以据此评估多模型编排对编码工作流的影响。
Cohere Labs 发布 Agentic Task Ecosystem 数据集,包含 69 万以上为 AI 智能体构建的工具。在测试工具能否独立完成一项职业任务的实验中,仅 2.6% 通过。
广汽集团与火山引擎通过火山杯Agent创新大赛,鼓励一线员工用 TRAE、ArkClaw 等工具开发 Agent,覆盖 NVH 研发、物流设备管理、智能座舱故障诊断和智驾路测等场景。
百度伐谋凭借青岛港船舶自动配载实践入选IDC《中国企业级Agent最佳实践与案例精选(投资回报率视角)-2026》报告最佳实践案例。伐谋2.0经248轮迭代对齐A-TOS原有算法基准,398轮时突破原天花板,核心指标整体超越原系统10%以上,配载效率从约3500箱/分钟升至约4300箱/分钟。截至目前伐谋已服务超过3000家企业,覆盖物流、零售、制造、AI4S、金融等行业。
蚂蚁集团正式开源面向真实金融工作流的 Ling-3.0-flash-Fin(124B A5.1B),为 MoE 架构、支持最长约 256K 上下文,并同步开放面向金融搜索 Agent 的评测基准 FinFIRST(Financial Information Retrieval, Sourcing and Traceability),中金公司投行团队在构建过程中提供专业支持。
Claude Code 发布 v2.1.260,新增全屏模式 diff 面板(/diff 切换)、/cost 显示提示缓存未命中原因、/reload-plugins 及文本形式 /advisor 命令。
Epoch AI 发布对 Terminal-Bench 4.0.0 的基准评测,因 66 个任务中 30 个(45.5%)存在公开记录的计分缺陷而将其定为 Flawed。
蚂蚁 inclusionAI 在 GitHub 发布 Choruz,一个本地优先的协作应用,让人类与 AI 智能体在类 Slack 空间中协作,每个 Agent 在独立工作区运行真实 CLI,可通过消息、线程、任务和文件交接工作。
xAI 宣布 Grok Bot 面向企业开放,Grok 和 Cursor Enterprise 客户未来两周可免费使用并邀请全组织成员,包括没有现有席位的员工。
推荐理由:原文给出企业版 Bot 的管控能力、真实使用场景和两周免费安排,企业用户可据此评估是否引入现有工作流。
OpenAI 发布 GPT-6 Astra,称这是其部署过的最强模型,也是首个在其 Preparedness Framework 下达到网络安全能力 Critical 级的模型,可在无人逐步引导的情况下发现未知安全漏洞并开发利用方式。
推荐理由:OpenAI 官方发布的安全评估,给出模型在网络安全能力、对齐和可监测性上的具体发现,读者可借此了解前沿模型安全实践的最新变化。
OpenAI 发布 Daybreak for Frontline Defenders 全球计划,承诺提供10亿美元的 Daybreak 补贴访问、培训、技术支持与合作,计划在未来六个月内消耗,优先支持水处理、电网、州和地方政府、社区银行、非营利组织和开源维护者等资源有限的一线防御者。
推荐理由:原文给出10亿美元补贴的具体构成、MS-ISAC 试点和35个以上合作产品,读者可据此了解 Daybreak 防御能力如何触达一线防守者。