Tomer Tunguz 解析 harness 的毛利机会:同一模型可省 71% 成本
Tomer Tunguz 撰文分析 Berkeley 本周发表的 HarnessTax 研究:控制 AI Agent 的 harness 系统可在不损失准确率的情况下,将同一结果的成本降低 71%(GPT-5.6 Sol 从 Claude Code 换到 Pi,每解决一个任务成本从 $1.540 降至 $0.441)。
Tomer Tunguz 撰文分析 Berkeley 本周发表的 HarnessTax 研究:控制 AI Agent 的 harness 系统可在不损失准确率的情况下,将同一结果的成本降低 71%(GPT-5.6 Sol 从 Claude Code 换到 Pi,每解决一个任务成本从 $1.540 降至 $0.441)。
Anthropic 让 Claude 在不到四周内优化了超过 30 个开源生物分子模型,平均提速约 4 倍、精度损失极小,输出完全一致时也有近 2 倍加速。优化代码全部开源,还推出低内存 Big 模式,可在单张 NVIDIA GPU 节点上对超过 10,000 token 的生物分子系统做准确预测。
推荐理由:Anthropic 公布了完整提速数据、开源代码和比赛入口,读者可以据此评估 AI 优化科学计算代码的实际水平。
Anthropic 宣布 Claude Code 的 Projects 改版,用户设定目标后由 Claude 拆解任务、协调并行线程、审查输出并汇总结果。每个线程是一个独立的 Claude Code 云会话,各占一个分支跑测试、开 PR,项目还带随时间积累的共享记忆和文件库。
推荐理由:官方说明了项目改版的线程协调机制、共享记忆和推送节奏,读者可以据此判断是否要加入等待名单。
GitHub 工程师 Stephen Toub 复盘用 Copilot 智能体在约 14.5 周内将 Copilot agent runtime 从 TypeScript/Node.js 全量重写为 832,378 行生产 Rust,AI 智能体完成大部分代码,共 128 个 PR 增量合入 main 并持续发布。
推荐理由:当事工程师复盘用 AI 智能体在数月内将 Copilot 运行时迁往 Rust 的全过程,策略、回归样本和成本数据对同类迁移有直接参考价值。
xAI 宣布 Grok Build 上线记忆功能,会在每轮对话结束后于后台记录项目约定、决策及事实,供后续会话读取。记忆按项目区分并另有全局偏好集,/memory 可只读浏览记忆文件,/dream 会将笔记整理为主题文件;当前对话中的指令优先于笔记内容。
推荐理由:原文说明了记忆的记录、整理和优先级机制,读者可以据此评估它对长期项目编码工作流的影响。
Arena 实习生 @melissapan 评测 7 个模型在 Claude Code、Codex 和 Pi 三种 harness 下的编码表现,共 21 个模型-harness 组合。
Odevo 在 AI Native DevCon London 分享了其 AI Native 转型经验:这家住宅物业管理公司七年内管理房屋从约 5 万套增至约 250 万套、员工从约 1000 人增至 14000 人,2024 年起步时仅约 30% 开发者使用 GitHub Copilot 等工具。
Tessl博客指出,AI编码代理导致PR数量激增但审查变慢,核心原因是缺乏对输出结果的信任。文章主张建立“验证层”,将产品意图转化为“可执行规范”。通过拆分规划与验证代理、结合规范与代码进行比对、并在隔离沙箱中运行以规避安全风险,旨在让代理自动检查实现是否符合原始需求,从而提升工程效率。
Tessl 博客整理作者在 AI Native DevCon London 的演讲,主张 AI 原生组织的核心是压缩交接,让有决策权的人能直接通过智能体完成工作。
Netlify 的 Dana Lawson 在 AI Native DevCon London 演讲提出智能体体验(AX)概念,认为构建者已从专业开发者扩展到非技术人群。
火山引擎宣布 Doubao-Seed-2.1-pro 更新至0915版本,API 已全量上线火山方舟,豆包 app 和 TRAE 同步接入。
推荐理由:榜单给出四款新模型在图像生成网站任务上的排名和每百万 token 价格,可据此比较性能与成本差异。
Factory 完成 2 亿美元融资,估值 50 亿美元,投资方包括 Blackstone、Khosla Ventures、Sequoia Capital、Insight Partners 等,累计融资超 4 亿美元。
Cognition 与 AWS 签订多年期战略合作协议(SCA),帮助企业客户在 AWS 生产环境中部署自主工程智能体 Devin,客户已可通过 AWS Marketplace 购买 Devin 并直接使用 Agent Toolkit for AWS。
Trail of Bits 发文批评 1Password 8月6日发布的 FLAWED 报告,称其 26% 的 AI 干净修复率受四项实验设计选择影响而失真,包括刻意指示智能体应用错误修复的提示词占 22% 数据、36% 的试验禁止编译测试,以及不同推理档位设置。
推荐理由:原文针对1Password基准的26%头条数字给出逐项方法学批评,并补充自身人类修复失败率与开源合并数据作对照。
百度智能云宣布千帆Token Plan个人版秋季升级,积分制套餐正式上线,与Token制并行运营,按输入、输出、缓存命中分别折算积分,四档套餐¥4.9起,最高165,000积分/月。
Fireworks 发布 DeepSeek-V4.1-Flash,在 DeepSWE 上取得 74.34% pass@1、每任务 $0.43,与 GPT-6 Astra 同一精度区间但成本仅 1/15。
推荐理由:官方以多基准实测给出 DeepSeek-V4.1-Flash 与闭源模型的成本质量对比和架构细节,可帮助开发者做选型与成本权衡。
Anthropic 工程师撰文分享如何在智能体编程压力下扩展测试影响分析服务。Claude 编写约 80% 的代码,测试数量增长 10x,六个月内 CI 任务增加 25x。文章复盘了三个临时补丁(扩容、按包分片、每日重启)分别只维持 70 天、29 天和不到一天,最终用三周重设计为无状态、内存存储加 journal 的可水平扩展架构,并建议团队按两季度内 25x 负载做容量规划。
推荐理由:作者复盘了智能体编程把 CI 推向 25x 负载的完整演进,给出可迁移的架构与容量规划经验。
Tessl 发文提出智能体转型的真正难点是上下文等要素的归属问题,而非 Agent 本身。核心规则是所有权跟随组织单元,个人与团队上下文归领域专家,组织级共享基础由赋能或平台团队托管并开放贡献,赋能团队只提供工具和基础设施而不拥有上下文。
推荐理由:文章把智能体转型的难点从模型转向上下文归属,给出按组织单元分层确权和赋能团队只供工具不拥有上下文的可迁移框架。
推荐理由:原文给出了参数规模、上下文长度、开源协议和定价,读者可据此评估它能否接入现有编码与 Agent 工具链。
OpenRouter 发布教程,讲解如何用独立的裁判模型按自定评分标准自动给 AI 智能体输出打分,覆盖确定性测试无法检查的开放式回答质量。
推荐理由:原文给出 LLM-as-a-judge 的适用边界、偏差来源和用 Ori Eval 落地的可复用步骤,还包含用人工标注校准裁判模型的方法。
OpenAI 开发者账号宣布发布 GPT-6 Astra,并汇总社区开发者基于它做出的构建案例,包括 2234 个建模解剖部件的 3D 展示、Unreal Engine 曼哈顿复刻。
DeepSeek 本周在 HuggingFace 开源 DeepSeek-V4.1-Flash 权重,模型总参数 552B,prefill 激活 8B、decode 激活 16B,支持 1M token 上下文和文本加图像输入,已上线 Baseten Model APIs。
推荐理由:文章解释了 CED 架构如何把 prefill 降到 8B 激活参数并压缩 KV cache,读者能理解它为何更适配编码智能体的高 prefill 负载。
GitHub 日韩地区营销负责人 Tomoko Tanaka 分享如何不写代码,把活动运营交给 GitHub Copilot 自动化。
推荐理由:作者以自身营销工作为例,展示了用 Issue、Actions 和 SKILL.md 复用开发者治理流程落地自动化的完整路径。
Google 发布 autofinetune 项目,把 autoresearch 的自主研究循环应用到 LLM 后训练(SFT 和 GRPO),使用 Tunix、Gemma、Cloud TPU,由 Antigravity CLI 和 Gemini Flash 3.7 编排。
Cursor 发布 Projects(beta),让用户通过协调者智能体处理功能开发、迁移和持续性维护等大型工作,协调者本身不写代码,而是调度数千个子智能体并行执行。
推荐理由:官方介绍 Projects 的三项核心能力,并给出内部使用数据,读者可据此判断它适合什么规模的工作。
GitHub Copilot 应用新增 diff、终端、浏览器三个内置面板,让初学者在不离开应用的情况下完成 AI 智能体改动的审查、运行和预览。diff 面板以红绿高亮显示增删改行,用户可接受、评论或要求修改;终端面板可运行项目命令并支持多窗口,浏览器面板配合 Pick & Polish 工具选中界面元素让智能体调整,最后可直接在应用内接受变更并创建 pull request。
OpenAI 推出 Agents API 公开测试版,将驱动 Codex 的 harness 与基础设施通过单次 API 调用开放给开发者,托管在云端。
推荐理由:原文给出环境选择、子智能体和上下文管理等具体能力与定价方式,读者可据此评估是否迁移现有 Agent 基础设施。
GitHub Next 的 Don Syme 在 AI Native DevCon London 演讲中提出,应在 CI 和 CD 之外增加第三个支柱 Continuous AI,即在软件生命周期中以定时、可审计、由仓库事件触发的 AI 工作流实现持续文档、代码改进和问题分拣。
Augment Code 发布长文,复盘其九个月建设的软件工厂:2025 年 11 月至 2026 年 7 月,基于 Cosmos 平台在需求、工单、PR、生产四个环节部署 PR Author。
推荐理由:Augment 复盘其软件工厂九个月的落地过程,给出了具体的量化结果和按瓶颈逐步自动化 SDLC 的可迁移方法。
DeepSeek 发布 DeepSeek-V4.1-Flash,是全新模型结构系列中最小尺寸的模型,具备原生多模态视觉理解能力,评测包括 GPQA Diamond 90.9、HLE 36.8、Codeforces Rating 3471、Terminal-Bench 2.1 90.6 等。
推荐理由:官方发布附带完整评测数字和 API 切换细节,读者可据此判断新模型能力水平及旧模型下线对现有调用和计费的影响。