广汽集团与火山引擎推动一线员工用 TRAE 等工具开发 Agent,落地研产供销全流程
广汽集团与火山引擎通过火山杯Agent创新大赛,鼓励一线员工用 TRAE、ArkClaw 等工具开发 Agent,覆盖 NVH 研发、物流设备管理、智能座舱故障诊断和智驾路测等场景。
广汽集团与火山引擎通过火山杯Agent创新大赛,鼓励一线员工用 TRAE、ArkClaw 等工具开发 Agent,覆盖 NVH 研发、物流设备管理、智能座舱故障诊断和智驾路测等场景。
OpenCode 发布新 stealth 模型 Omen Alpha,仅对 OpenCode Go 订阅用户开放。定价为 $10 可获 $100 用量。
百度伐谋凭借青岛港船舶自动配载实践入选IDC《中国企业级Agent最佳实践与案例精选(投资回报率视角)-2026》报告最佳实践案例。伐谋2.0经248轮迭代对齐A-TOS原有算法基准,398轮时突破原天花板,核心指标整体超越原系统10%以上,配载效率从约3500箱/分钟升至约4300箱/分钟。截至目前伐谋已服务超过3000家企业,覆盖物流、零售、制造、AI4S、金融等行业。
上海人工智能实验室推出 SciDocBench,一个面向科学文档理解的以工作流为中心的评测基准与数据管线,含 124 道人工设计题目、7 大能力组 19 个子任务、5 个科学领域,共 496 个匹配评测实例。
蚂蚁 inclusionAI 发布开源统一图像生成与编辑模型 LLaDA-Image,提供 50 步 Base 和 4 步蒸馏 Turbo 两类 checkpoint,均有 BF16 与 FP8 版本。
蚂蚁 inclusionAI 发布开源统一图像生成与编辑模型 LLaDA-Image 家族,包括 6B 参数、50 步采样的 Base 版和 2-4 步的 Turbo 蒸馏版,同时提供 BF16 与 FP8 checkpoint 及 Diffusers 推理代码。
蚂蚁集团正式开源面向真实金融工作流的 Ling-3.0-flash-Fin(124B A5.1B),为 MoE 架构、支持最长约 256K 上下文,并同步开放面向金融搜索 Agent 的评测基准 FinFIRST(Financial Information Retrieval, Sourcing and Traceability),中金公司投行团队在构建过程中提供专业支持。
Claude Code 发布 v2.1.260,新增全屏模式 diff 面板(/diff 切换)、/cost 显示提示缓存未命中原因、/reload-plugins 及文本形式 /advisor 命令。
Meta Superintelligence Labs 首个图像模型 Muse Image 在 Artificial Analysis Image Arena 首次上榜。
Epoch AI 发布对 Terminal-Bench 4.0.0 的基准评测,因 66 个任务中 30 个(45.5%)存在公开记录的计分缺陷而将其定为 Flawed。
Epoch AI 报告估计华为 2026 年将生产约 150 万颗 Ascend 芯片,折合 88 万 H100e,不足 Nvidia 算力产出的 4%,芯片性能落后 Nvidia 三到四年,单芯片纸面差距明年扩至约 17.5 倍。
推荐理由:报告用逐项建模拆解华为与 Nvidia 的算力差距,指出瓶颈将从 HBM 供给转向单芯片性能,结论可检验。
Epoch AI 基于 Frontier Data Centers 数据集(308 条里程碑、86 座设施)估算,自 2024 年年中以来最大在运数据中心的 IT 功率以每年 2.3 倍增长,90% 置信区间对应约 10 个月翻倍。
蚂蚁 inclusionAI 在 GitHub 发布 Choruz,一个本地优先的协作应用,让人类与 AI 智能体在类 Slack 空间中协作,每个 Agent 在独立工作区运行真实 CLI,可通过消息、线程、任务和文件交接工作。
Gary Marcus 发文点评 GPT-6 Astra,称多项报告显示其为真正的进步,OpenAI 产品显式创建并操纵符号世界模型,令其近十年的主张获得印证。
推荐理由:作者结合自身近十年主张神经符号世界模型的立场,指出 Astra 的关键未知在鲁棒性与可监控性,判断有具体依据。
xAI 宣布 Grok Bot 面向企业开放,Grok 和 Cursor Enterprise 客户未来两周可免费使用并邀请全组织成员,包括没有现有席位的员工。
推荐理由:原文给出企业版 Bot 的管控能力、真实使用场景和两周免费安排,企业用户可据此评估是否引入现有工作流。
现在你可以通过 Hermes 一键在本地运行 Unsloth GGUF 了!✨ Qwen3.8-27B、Qwen3.8-Flash、DeepSeek-V4-Flash 等均已支持。
OpenAI 发布 GPT-6 Astra,称这是其部署过的最强模型,也是首个在其 Preparedness Framework 下达到网络安全能力 Critical 级的模型,可在无人逐步引导的情况下发现未知安全漏洞并开发利用方式。
推荐理由:OpenAI 官方发布的安全评估,给出模型在网络安全能力、对齐和可监测性上的具体发现,读者可借此了解前沿模型安全实践的最新变化。
OpenAI 发布 Daybreak for Frontline Defenders 全球计划,承诺提供10亿美元的 Daybreak 补贴访问、培训、技术支持与合作,计划在未来六个月内消耗,优先支持水处理、电网、州和地方政府、社区银行、非营利组织和开源维护者等资源有限的一线防御者。
推荐理由:原文给出10亿美元补贴的具体构成、MS-ISAC 试点和35个以上合作产品,读者可据此了解 Daybreak 防御能力如何触达一线防守者。
Databricks 发布博客,介绍组织在迈向 AI 与数据驱动时,如何借助 Databricks 构建高质量且可信的数据产品。正文从企业在 AI 和数据驱动转型中需要交付数据产品这一需求展开。
Databricks 发文讨论面向 AI 的数据治理,指出多数组织将治理等同于安全控制,而文章主张治理还应覆盖知识、上下文与本体层面。文章围绕 lakehouse 提出超越安全视角的治理思路,原文正文仅给出开篇部分。
Midjourney 向 alpha.midjourney.com 推送大型更新,新的 v8.2 编辑模型上线,lightbox 内置编辑器支持自然语言指令编辑、最多附 4 张参考图并集中查看会话编辑记录。同时测试 Change Style 风格探索功能,修复大量 bug,Niji 7 加 inpainting 已正常工作;下一步将设置默认参数和用提示词预览 sref。
Midjourney 员工 Caleb 宣布开始征集用户对后续优先事项的反馈和想法,提交入口为 midjourney.com/ideas,官方将在未来一两周内组织正式投票。
xAI 就 Memphis 算力中心当天上午的故障导致 Grok 使用异常道歉,并向受影响的算力合作伙伴致歉。目前所有系统已恢复并正常运行。
OpenAI Developers 宣布 GPT-6 Astra 是其在电脑使用、软件工程和视觉理解方面迄今最好的模型,并附上正在使用该模型的开发者的视频分享。
Google Research 用 UK Biobank 约数十万欧洲样本与 Biobank Japan 近 20 万日本样本,在 8 项临床性状上评估多基因风险评分(PRS)的跨人群迁移效果。结果显示,目标人群样本达 15k 以上时,目标人群专属模型优于混合欧洲数据训练;遗传相关性高的性状可继续受益于欧洲数据至 25-40k+ 样本,而 HDL、LDL、血糖等高度人群特异性性状受益明显更小。
Legora 使用 GPT-6 Astra 在数分钟内审阅 41 份文件,找出全部 4 处植入错误,该财务审查工作流性能提升近 40%。
Playco 使用 GPT-6 Astra,从一个 grey box 基础搭建出三个主题游戏原型,并报告手动修复比使用前一模型减少 50%。
xAI 发布设计文章,介绍 Grok Bot 如何为超越单次会话的持久化智能体设计界面。产品以 Bot 为主要对象而非会话,Bot 拥有身份、记忆、自己的计算机和工具;头像动效呈现空闲、工作、等待、阻塞、思考、完成等状态;工作区提供状态、预览、接管三级访问。
推荐理由:xAI 官方复盘 Grok Bot 的界面设计决策,读者可以了解持久化智能体产品在组织方式和交互上的取舍思路。
Tom Tunguz 分析 Meta 发布 Muse Spark 模型及双轨 API 定价:Standard Tier(muse-spark-1.3)输入 $1.25/m。
推荐理由:作者用价差算出数据补贴的具体规模,把 Meta 双轨定价解读为 AI 数据供应链的垂直整合,提供了一种可迁移的分析视角。
Sierra 发布呼叫中心 AI 运营与落地指南,提供生命周期地图和 go/no-go 检查清单,覆盖路由、人员配置、技术控制、故障接管与扩展规划。
LangChain 在 langchain.mcp 中加入 MCP 支持,基于 FastMCP 构建,适配 2026-07-28 规范。Elicitation 通过 LangGraph interrupt 处理,工具列表支持缓存。