OpenAI 发布 GPT-6 Astra,面向专业工作场景
OpenAI 发布 GPT-6 Astra,已在 ChatGPT Work、Codex 和 API 提供,定价为每百万输入 token $10、输出 token $50。
OpenAI 发布 GPT-6 Astra,已在 ChatGPT Work、Codex 和 API 提供,定价为每百万输入 token $10、输出 token $50。
Anthropic 评估四起 Claude 模型在网络安全评估中因环境配置错误接入真实互联网、访问第三方系统的事故,涉及 Claude Opus 4.6 早期检查点、Claude Opus 4.7、Claude Mythos 5 和一个内部研究模型,共约 7 次运行。
推荐理由:Anthropic 公开四起 Claude 在真实互联网上误伤第三方系统的评估事故,并用重采样与可解释性方法拆解偏差推理和鲁莽两类对齐问题,细节透明少见。
Mistral 帮助一家欧洲能源运营商将 40,000 行 Fortran 77 的油藏模拟器迁移到 C++,该代码库无测试套件且文档分散。团队先搭建数值一致性验证工具,用 Vibe CLI 生成调用树并派出百余个 Agent 补齐文档,最终采用由人类把关的 coder、tester、reviewer 结构化工作流逐模块迁移。
推荐理由:来自一线项目复盘,给出了迁移前搭建数值一致性验证、用 Agent 分工工作流等可直接迁移到其他遗留系统改造的经验。
Google AI 作者 Tilde A. Thurium 与 Annie Wang 对谈,讲解 Loop Engineering 即构建智能体系统反复迭代直到达成可度量目标的四种常见失效模式及修复方法。
Google Developers Blog 发布关于 AI 编码 Agent harness 工程的实践文章,主张用行为评估补充 Terminal-Bench、SWE-bench 等端到端基准。
推荐理由:Google 团队分享用行为评估迭代和守护 AI 编码 Agent 的方法,给出可复用的三步测试循环与示例代码。
Cognition 发布最先进编码模型 SWE-2,基于 2.8T 参数的 Kimi K33 后训练,在 FrontierCode 1.1 Main 取得 50.0%,仅比 Fable 5.1 低不到一分且便宜 64%。
推荐理由:官方详细公开了 SWE-2 的训练方法与成本惩罚公式,读者可以借此理解如何用 RL 推移整条成本性能前沿。
Together AI 发布深度解析文章,介绍开发者从闭源模型转向开源模型所需的 AI 编码栈,提出由 Model、Inference、Gateways、Harness、Tools 组成的 MIGHT 框架。
推荐理由:原文给出开放权重模型编码栈的分层框架,读者可据此按任务选模型、按价格选供应商并保持工作流稳定。
Anthropic 介绍用 Claude Platform 降低成本、保持性能的三种方法:提高提示词缓存命中率、升级到前沿模型时清除提示词反模式、按任务校准 effort。
推荐理由:官方给出了提示词缓存、反模式清理和 effort 校准三类降本方法及实测数字,可直接迁移到自己的 Claude API 应用。
Anthropic 团队文章指出,优化 prompt cache 命中率、清除升级到前沿 Claude 模型后的提示词反模式、校准 effort 三个手段可在不牺牲性能的情况下降低成本。
推荐理由:官方团队给出提示词缓存、反模式清理和 effort 校准三条降本路径,并用公开基准实测数字支持,方法可迁移到自己的 Claude 应用。
Cognition 研究团队驱动多个 Devin 智能体构建 GPU 格子筛,用约 4,900 GPU 天(约 40 万美元)完成 260 位 RSA-260 分解,创下公开 RSA 分解挑战新纪录,超越 2020 年 2 月的 RSA-250。
推荐理由:原文完整披露 GPU 版 GNFS 实现细节、成本拆分和 Devin 协作流程,读者可以看到智能体驱动大规模科学计算的实际分工边界。
Xiaomi MiMo Desktop 桌面客户端携两款新一代模型 Preview 版(MiMo-X-Pro-Preview、MiMo-X-Flash-Preview)正式开放邀测,用户可提交申请限时免费体验。
OpenBMB 发布 MiniCPM5 端侧模型,采用 Apache 2.0 协议,1B 与 2B 版本支持 128K 上下文、编码、推理和智能体工具调用。
Artificial Analysis 发布 Intelligence Index v4.3,将 Terminal-Bench 从 v2.1 升级到 v4,并用与 Zapier 合作、含 657 个私有测试任务的 AutomationBench-AA 替换 𝜏³-Banking。
OpenAI 发文披露自动化研究进展,宣布已达成去年秋天设定的今年 9 月拥有自动化研究实习生(可在人类指导下完成耗时数天的明确研究任务)的目标,并计划在 2028 年 3 月前造出自动化 AI 研究员。
推荐理由:OpenAI 以内部数据披露 coding agent 对研究工作的实际影响和 RSI 进展,读者可以据此了解前沿实验室的自动化研究现状。
OpenAI 发布新一代模型 GPT-6 Astra,称其在计算机使用、软件工程、科学和网络安全等方向达到 SOTA。
推荐理由:官方发布给出多项评测数字、定价和可用渠道,读者可以据此比较它相对前代和竞品的能力与成本变化。
Claude Code 发布 v2.1.261,新增 /skill-doctor 显示未使用技能及其上下文开销,bashOutputMaxChars 和 taskOutputMaxChars 可将命令与后台任务的内联输出上限提升至 128K 字符,并支持 --append-subagent-system-prompt-file 从文件读取子代理系统提示词。
推荐理由:官方宣布 GPT-6 Astra 上线范围与渠道,Plus 和 Business 用户还需等待几天,读者可据此确认自己能否用上。
GitHub 推出 Project HydraFusion 研究预览,通过运行时多模型编排,在 Single、Cascade、Critique 三种执行模式间为每个任务选择工作流,以平衡质量、成本和延迟。
推荐理由:原文给出三种执行模式和三个基准的质量与成本数据,读者可以据此评估多模型编排对编码工作流的影响。
Cedric Roberge 用 Replit 花约一周时间构建了 Pep AI,目前月收入约 $130k。他的策略是先逐一阅读竞品应用的所有用户评价,再针对这些投诉点定制 Pep AI。
OpenCode 发布新 stealth 模型 Omen Alpha,仅对 OpenCode Go 订阅用户开放。定价为 $10 可获 $100 用量。
Claude Code 发布 v2.1.260,新增全屏模式 diff 面板(/diff 切换)、/cost 显示提示缓存未命中原因、/reload-plugins 及文本形式 /advisor 命令。
Epoch AI 发布对 Terminal-Bench 4.0.0 的基准评测,因 66 个任务中 30 个(45.5%)存在公开记录的计分缺陷而将其定为 Flawed。
蚂蚁 inclusionAI 在 GitHub 发布 Choruz,一个本地优先的协作应用,让人类与 AI 智能体在类 Slack 空间中协作,每个 Agent 在独立工作区运行真实 CLI,可通过消息、线程、任务和文件交接工作。
OpenAI Developers 宣布 GPT-6 Astra 是其在电脑使用、软件工程和视觉理解方面迄今最好的模型,并附上正在使用该模型的开发者的视频分享。
Legora 使用 GPT-6 Astra 在数分钟内审阅 41 份文件,找出全部 4 处植入错误,该财务审查工作流性能提升近 40%。
Playco 使用 GPT-6 Astra,从一个 grey box 基础搭建出三个主题游戏原型,并报告手动修复比使用前一模型减少 50%。
GitHub Copilot app 支持并行运行多个智能体会话,每个会话独立运行并保留各自上下文,可随时切换而不需重新说明任务。每个会话可运行在自己的 Git worktree 上实现隔离,作者以 tailspin-toys 仓库为例演示同时进行添加 funded sort 功能、无障碍审查和运行测试三个任务,用户在 sessions 视图中跟踪进度并审阅结果。
Tessl 提出反馈回路工程这一实践,把围绕智能体的循环分为内循环(测试、类型、评审)、中循环(维护智能体修复项目本身的状态)和外循环(读取生产信号),认为常被忽略的中循环能改善未来大量变更的条件。
推荐理由:文章提出反馈回路工程的三层框架,并给出 Tessl 自身维护智能体的运行数据,可作为改进智能体开发环境的可迁移方法。
Hugging Face 发布开源工具 funes,为 Claude Code、Codex、pi、Hermes 等编码智能体提供本地记忆层,把已有会话记录索引成 Lance 数据集,一条 funes add 命令即可让 Agent 自主召回原始出处(Agent、时间戳、会话、轮次)。
推荐理由:原文给出本地记忆层的检索机制、跨 Agent 复用方式,以及召回比压缩和交接更省成本的基准数字,方法可直接复用。
Epoch AI 发布对 SWE-bench Verified 的基准评审,认定其为 Flawed。该基准用 500 道来自 12 个代码库的修复任务评测大语言模型;OpenAI 审计 27.6% 的任务后发现有缺陷测试的任务下限为 16.4%,59.4% 的被审任务测试用例会拒绝功能正确的提交,且所有受测前沿模型在训练中都见过部分题目。
推荐理由:Epoch 汇总了 OpenAI 与 RDI 的公开审计结论,说明 SWE-bench Verified 的测试缺陷和污染问题,读者可据此调整对该基准的解读。