Google AI 讲解 Loop Engineering 的四种失效模式及修复方法
Google AI 作者 Tilde A. Thurium 与 Annie Wang 对谈,讲解 Loop Engineering 即构建智能体系统反复迭代直到达成可度量目标的四种常见失效模式及修复方法。
Google AI 作者 Tilde A. Thurium 与 Annie Wang 对谈,讲解 Loop Engineering 即构建智能体系统反复迭代直到达成可度量目标的四种常见失效模式及修复方法。
Google Developers Blog 发布关于 AI 编码 Agent harness 工程的实践文章,主张用行为评估补充 Terminal-Bench、SWE-bench 等端到端基准。
推荐理由:Google 团队分享用行为评估迭代和守护 AI 编码 Agent 的方法,给出可复用的三步测试循环与示例代码。
Cognition 发布最先进编码模型 SWE-2,基于 2.8T 参数的 Kimi K33 后训练,在 FrontierCode 1.1 Main 取得 50.0%,仅比 Fable 5.1 低不到一分且便宜 64%。
推荐理由:官方详细公开了 SWE-2 的训练方法与成本惩罚公式,读者可以借此理解如何用 RL 推移整条成本性能前沿。
Vercel Labs 发布实验性语法高亮工具 gpu-lexer,用 27.4KB 的 WebGPU 模型对任意语言源码做 token 标注,无需按语言选择语法。在 5.56M 字符输入上高亮耗时 402ms,快于 Prism.js 和 Shiki;在留出文件上与 Shiki 的标注一致率为 88.02%,Top-25 加权一致率 90.35%,作者强调这是实验而非语法等价的高亮器。
OpenAI Codex 负责人 Tibo Sottiaux 表示 GPT-6 Astra 需求前所未有,若持续上涨可能临时暂停新的 Pro 订阅,但现有用户订阅不受影响。Astra 于 9 月 3 日开放,上线初期遭遇算力瓶颈,官方推出额度重置补偿,并称优化后额度消耗最多可降至原来的四分之一到三分之一;Codex 此前周活跃用户约 2000 万。
卡兹克发文讲解GPT-6 Astra的推理强度等级(Reasoning Effort)含义,指出各档位是同一模型的不同思考预算,Ultra则类似拉起多个智能体协作的专项工作组。
推荐理由:作者基于烧完两个200刀会员的第一手使用体感,给出推理等级的通俗解释和分档位省Token的具体用法。
Together AI 发布深度解析文章,介绍开发者从闭源模型转向开源模型所需的 AI 编码栈,提出由 Model、Inference、Gateways、Harness、Tools 组成的 MIGHT 框架。
推荐理由:原文给出开放权重模型编码栈的分层框架,读者可据此按任务选模型、按价格选供应商并保持工作流稳定。
Inception 发布 Mercury 2.5,称其为目前最强扩散大语言模型,智能较 Mercury 2 提升 40%,在 NVIDIA GPU 上达 1,107 tokens 每秒,上下文 260K tokens,定价 $0.20/百万输入、$0.75/百万输出,发布期 8 折优惠。
Cognition(Devin 开发商)宣布以 480 亿美元估值融资 20 亿美元,由 Andreessen Horowitz、Accel、Founders Fund、General Catalyst 和 Avenir 领投,距上次 260 亿美元估值融资仅四个月。
GitHub 上的 i-have-adhd 项目提供一个 skill,用于防止编码智能体把最终答案深埋在输出里。该项目经由 Hacker News 热门讨论传播,HN 获得 101 分。
Anthropic 介绍用 Claude Platform 降低成本、保持性能的三种方法:提高提示词缓存命中率、升级到前沿模型时清除提示词反模式、按任务校准 effort。
推荐理由:官方给出了提示词缓存、反模式清理和 effort 校准三类降本方法及实测数字,可直接迁移到自己的 Claude API 应用。
Anthropic 团队文章指出,优化 prompt cache 命中率、清除升级到前沿 Claude 模型后的提示词反模式、校准 effort 三个手段可在不牺牲性能的情况下降低成本。
推荐理由:官方团队给出提示词缓存、反模式清理和 effort 校准三条降本路径,并用公开基准实测数字支持,方法可迁移到自己的 Claude 应用。
Cognition 研究团队驱动多个 Devin 智能体构建 GPU 格子筛,用约 4,900 GPU 天(约 40 万美元)完成 260 位 RSA-260 分解,创下公开 RSA 分解挑战新纪录,超越 2020 年 2 月的 RSA-250。
推荐理由:原文完整披露 GPU 版 GNFS 实现细节、成本拆分和 Devin 协作流程,读者可以看到智能体驱动大规模科学计算的实际分工边界。
Xiaomi MiMo Desktop 桌面客户端携两款新一代模型 Preview 版(MiMo-X-Pro-Preview、MiMo-X-Flash-Preview)正式开放邀测,用户可提交申请限时免费体验。
OpenBMB 发布 MiniCPM5 端侧模型,采用 Apache 2.0 协议,1B 与 2B 版本支持 128K 上下文、编码、推理和智能体工具调用。
论文提出以数据为中心的 Feyospace-v1 框架,通过五套系统与可重置的编码、漏洞、CTF、内核历史、完整利用、固件和设备环境生成数据,经执行验证和证据审计后保留 164,269 条轨迹用于长上下文监督微调。
研究团队发布 SWE-Bench Pro Verified,一个包含 731 个实例的软件工程智能体评测基准,通过仓库重建、测试工件隐藏、元数据匿名化和代码托管域名封堵来阻断答案泄露,并由人类专家最小化修订 102 个存在质量问题的任务。
博主 _alternator_ 撰文讨论湖南大学 Wang & Wu 的新预印本,其证明自 1974 年悬置的球面 Hadwiger 猜想时声明使用了 OpenAI Codex 协助完善证明细节、查找缺口和排版编辑。
OpenAI 发布博客首次披露研究人员使用 AI 编程智能体的规模和成本。截至 8 月中旬,普通研究员日耗 Token 价值中位数超 600 美元(7 月为 162 美元),前 10% 用户超 7000 美元,数字按 API 公开推理价格估算,非实际支出。
作者分享只用手机远程操控Agent跑任务的新工作流,核心工具是UU远程,出门不再随身背1.62kg的MacBook。文中介绍终端完整支持TUI,可正常操作Claude Code、Codex等Coding Agent,多终端会话可并行;支持手机与电脑双向跨端接管,任务进度和运行状态可保留。
Arena(arena.ai)平台发布 2026 年第 36 周(8 月 31 日~9 月 6 日)AI 大模型盲测排名。
Simon Willison 评论 OpenAI 关于 Recursive Self-Improvement(RSI)的新文章及首席科学家 Jakub Pachocki 的 essay《An Alien Mind》。
Meta FAIR、牛津大学和 UCL 团队提出 AI Research Preference Models(RPMs),在执行前对未运行的 ML 实验候选排序,只执行获胜者。
Artificial Analysis 发布 Intelligence Index v4.3,将 Terminal-Bench 从 v2.1 升级到 v4,并用与 Zapier 合作、含 657 个私有测试任务的 AutomationBench-AA 替换 𝜏³-Banking。
OpenAI 发文披露自动化研究进展,宣布已达成去年秋天设定的今年 9 月拥有自动化研究实习生(可在人类指导下完成耗时数天的明确研究任务)的目标,并计划在 2028 年 3 月前造出自动化 AI 研究员。
推荐理由:OpenAI 以内部数据披露 coding agent 对研究工作的实际影响和 RSI 进展,读者可以据此了解前沿实验室的自动化研究现状。
Ben Evans 撰文分析 AI 为何难以像硅谷期待的那样直接扫清企业软件的重复任务。他指出多数人不是工具建造者,发现该自动化什么、以及如何重新定义问题才是难点;企业软件长期处于制度化与自发的光谱上,AI 只是制造新选择、移动阈值,而不改变问题本身。
微软发布快速入门指南,开发者借助 AI、VS Code、winapp CLI 和 GitHub Copilot 免费版,从空文件夹开始约 30 分钟即可创建并发布 WinUI 3 应用,无需安装 Visual Studio,流程包括让 AI 智能体添加功能、测试、打包成 MSIX 并提交 Microsoft Store。