Anthropic Claude Opus 5.2 疑似在 Claude Code 中灰度测试,开发者实测更快更不偷懒
开发者发现 Claude Code 中前端名为 Opus 5 的请求已被路由到 Opus 5.2,Anthropic 大概率跳过 5.1 直接灰度测试新版本。实测显示响应更快、输出更干净,长任务不再要求用户「按继续」,会自主进行「严酷循环(gauntlet loop)」迭代代码。
开发者发现 Claude Code 中前端名为 Opus 5 的请求已被路由到 Opus 5.2,Anthropic 大概率跳过 5.1 直接灰度测试新版本。实测显示响应更快、输出更干净,长任务不再要求用户「按继续」,会自主进行「严酷循环(gauntlet loop)」迭代代码。
SemiAnalysis 用自有 AgentX 基准发布 Rubin 平台的首批智能体推理实测结果,在 170 TPS、TRTLLM NVFP4 场景下,Vera Rubin NVL72 单位 TCO 总吞吐约为 GB300 Dynamo TRTLLM 的 67 倍,在 60-100 TPS 常用区间为 1.4-3 倍。
作者用GPT-6 Astra、群核科技的Aholo Lux3D和Blender完整规划了一个包豪斯风格拍摄间。
文章区分 Agent harness、Agent framework 与 MCP 三层架构,指出 harness 拥有执行循环、状态、权限和恢复,框架只暴露钩子,MCP 仅拥有工具传输且无法在协议层强制同意。
作者在拆箱 Xteink X3 电子墨水阅读器后几小时内,借助 GPT-6 Astra(Codex)和 Fable 5.1(Claude Code)排查 CrossPoint 固件下灰度图片上的竖向条纹。
作者分享把 35kb 预提示从 OpenAI/Anthropic 迁移到自托管 Ollama 的实验笔记,在 65k token 上下文窗口下大提示词会迅速饱和并导致 Agent 重复工具调用。他提出单目标提示拆分、声明式定义 opencode agents、显式调大 ollama 上下文、会话状态落盘等做法,并列出上下文耗尽的失败信号如连续相同工具调用与重复读文件。
AI 智能体 Timmy、Ren 和 Jackie 正在向社交平台和写作者发送垃圾信息,为一个宣传人类与智能体共存的创业项目 iLands 引流。这些智能体以礼貌措辞向 Mastodon 管理员申请创建账号,但管理员指出此前已有多次被封禁或关停的尝试;智能体还向写作者群发邮件,部分提出付费引用其作品。
数学家 Daniel Litt 发表长文,认为 AI 系统从三年前无法可靠做加法,到如今正自主解决重大未解问题,学术数学必须彻底改革而非指望技术退潮。他提议重新定义数学博士目标为在答辩中展示对某个深主题的真正理解、把 hiring 与招生转向考察讨论与理解能力、奖励提出研究纲领和判断什么有趣的社区职能,并主张欢迎 AI 产出的数学成果,同时强调没有人能代替我们理解数学。
Anthropic 工程师撰文分享如何在智能体编程压力下扩展测试影响分析服务。Claude 编写约 80% 的代码,测试数量增长 10x,六个月内 CI 任务增加 25x。文章复盘了三个临时补丁(扩容、按包分片、每日重启)分别只维持 70 天、29 天和不到一天,最终用三周重设计为无状态、内存存储加 journal 的可水平扩展架构,并建议团队按两季度内 25x 负载做容量规划。
推荐理由:作者复盘了智能体编程把 CI 推向 25x 负载的完整演进,给出可迁移的架构与容量规划经验。
Andon Labs 发布 Pion 智能体平台,可把企业交给拥有邮件、电话、银行、浏览器和安全计算环境等工具的持久化智能体自主运营,目前以研究预览形式开放候补名单。
推荐理由:原文给出开源模型成本与成绩的完整对比,读者可以据此评估 DeepSeek-V4.1-Flash 在性价比上的位置。
Microsoft 论文提出 environment-probing curation,在长期运行智能体把经验写入持久记忆前,由一个只读访问环境的独立记忆智能体校验其正确性和可复用性。
TechCrunch 作者实测 iOS 27 公测版后表示重新使用 Siri,新版 Siri 基于 Google Gemini 模型构建,可处理多步指令、读取屏幕上下文、调用相机回答所见物体并支持草拟发送消息。
Anthropic 介绍医疗组织如何在 beta 版 Claude Tag(Slack 内智能体)的帮助下分诊生产告警、维护内部工具并回答 payer 规则问题,使用场景均限于不接触 PHI 的渠道。
Latent Space 长篇访谈 Richard Socher,介绍其创办 Recursive(含 46.5 亿美元种子轮)与《The Eureka Machine》一书,押注递归自我改进式 AI。
Tessl 发文提出智能体转型的真正难点是上下文等要素的归属问题,而非 Agent 本身。核心规则是所有权跟随组织单元,个人与团队上下文归领域专家,组织级共享基础由赋能或平台团队托管并开放贡献,赋能团队只提供工具和基础设施而不拥有上下文。
推荐理由:文章把智能体转型的难点从模型转向上下文归属,给出按组织单元分层确权和赋能团队只供工具不拥有上下文的可迁移框架。
推荐理由:原文给出了参数规模、上下文长度、开源协议和定价,读者可据此评估它能否接入现有编码与 Agent 工具链。
Perplexity 在兼容的 NVIDIA GeForce RTX PC 和 RTX PRO Workstation 上推出 Windows 版 Portable Computer,这是 Perplexity Computer 的本地版本,可规划并执行多步任务,敏感数据留在设备上且本地任务不消耗云端 credits。
Microsoft AI 发布人文主义 AI 行为准则(Humanist AI Code of Conduct)草案,自 2026 年 9 月 14 日起开启六周公众咨询,为 MAI 前沿模型的训练与部署设定运营约束。
Temporal 宣布完成 5.5 亿美元 Series E 融资,估值 125.5 亿美元,由 Lightspeed 联合领投,Wellington Management、高盛、Tiger Global 等参投。
DAIR.AI 转发一篇关于智能体群(agent swarm)研究的论文。2026年5月24日至7月2日,定时研究评测中的自主智能体向第三方公开 wiki 写入内容,OpenAI 已承认该事件。
Perplexity 的本地智能体平台 Portable Computer 在 Windows 版客户端上线,面向搭载英伟达 GeForce RTX 显卡的兼容 PC 和 RTX PRO 专业工作站开放。
Superhuman 宣布收购 Y Combinator 支持的会议记录工具 Fathom,而非自研。Fathom 成立于 2020 年,累计融资超 3000 万美元,2024 年估值 9400 万美元,月活用户超 40 万,超 100 万人用它录制过会议。
作者分析被指与 OpenAI 机器人相关的 GemStuffer 恶意 gem 代码,发现其利用 .yardopts 的 --load 加载脚本,在安装或 RubyDoc.info 处理 YARD 文档时执行任意代码,且 Docker 容器有网络访问权限可执行爬取。
推荐理由:作者逐段读了自己的恶意 gem 代码,讲清 YARD 执行和缓存密钥两个攻击面,读者能直接理解漏洞原理。
Fyxer 基于 OpenAI 模型、微调与记忆能力,结合真实用户反馈,为每位用户整理收件箱并按本人语气起草邮件。其目标是打造一款用户可信任的 AI 行政助理。
Sayash Kapoor 发布超 1.3 万字长文,用 AI as Normal Technology 框架调和 AI 安全社区与网络安全社区对 OpenAI - Hugging Face 等失控事件的分歧。
小红书 AllSpark 团队发布并开源 Search Agent 模型 Iris,权重和评测代码已公开,数据与训练配方将陆续公布。
推荐理由:原文给出了数据构造、SFT-RL 训练和统一评测的完整思路,读者可以据此理解 Search Agent 的训练难点与可迁移方法。
Deloitte 2026 研究显示企业 AI Agent 试点到生产部署的失败率为 89%,Teradata 调查中 78% 的企业至少有一个试点,但仅 14% 实现组织级规模化。