EvoSafeHarness:为 LLM Agent 自动搜索模型与领域专属的安全 Harness
论文提出 EvoSafeHarness,围绕冻结模型和目标领域自动搜索由自然语言策略与可执行代码组成的安全 harness。
论文提出 EvoSafeHarness,围绕冻结模型和目标领域自动搜索由自然语言策略与可执行代码组成的安全 harness。
Anthropic 为 Claude iOS 应用加入苹果 CarPlay 支持,用户可通过车载信息娱乐系统与 Claude 进行免提语音对话。该功能无法控制车辆或 iPhone 上的其他功能,且 CarPlay 暂不支持第三方唤醒词,需先在 CarPlay 界面手动打开 Claude 应用。
Anthropic 于 9 月 4 日宣布,Claude 在基本自主运行 11 天后,完成费马大定理首个端到端、经计算机检查的 Lean 形式化证明。
Anthropic 宣布 Claude 完成费马大定理的首个完整机器验证证明,Claude 在 11 天内以多个智能体将基于 Wiles 的证明转化为 Lean 代码。
周四早晨,OpenAI、Anthropic 和 xAI 的前沿模型服务先后出现罕见中断。OpenAI 称,9 月 3 日上午 7:43(太平洋时间)起一个路由错误导致部分用户无法使用 ChatGPT 和 Codex。
Anthropic 宣布 Claude 上月完成了 Fermat 大定理的首个形式化证明,这是迄今最大的 Lean 证明。
推荐理由:原文给出证明规模、验证范围和完整代码入口,读者可以据此了解 AI 形式化数学论证的实际能力边界。
Anthropic 计划 IPO,估值最高可达 2 万亿美元,其 Long-Term Benefit Trust(LTBT)治理结构受到密切审视。该信托由少数顾问组成,不持有公司股权,但控制董事会多数席位,旨在保护公司长期造福人类的 AI 使命,公司计划上市后保留其角色。
Newcomer 专栏评论 Tim Cook 退休,称其执掌 Apple 期间市值从 3470 亿美元增至近 4.7 万亿美元,但硅谷如今缺少能获得全行业广泛尊重的领袖。
Simon Willison 宣布八月赞助者专属月度通讯已发布,赞助者可访问阅读。本期内容涵盖 OpenAI 意外网络攻击的更多细节、用 Fable 5 和 Sol 5.6 一次生成 Raccoon Heist 游戏、Claude auto mode、理解 ChatGPT Work、模型发布、杂项、他的项目及当前在用的工具。
OpenAI 发布目前最强的大语言模型 GPT-6 Astra,称其首次达到“关键”级网络安全能力门槛,但也承认模型可监控性有所下降,已强化安全防护。同日 Downdetector 报告 ChatGPT、Claude、Grok、Cursor 服务在美国集体出现故障,后已恢复正常。早报还涵盖华为国行 5G 回归、微短剧统一标识“苔花标”发布等内容。
ChatGPT、Claude、Codex 和 Grok 在同一时间窗口内出现服务中断,OpenAI 和 Anthropic 均确认错误率升高。
Anthropic 团队正在探索扩展和自定义 Claude Code 的新方式:Function Hooks,并发布演示视频展示其用途。该功能尚未发布,团队在 GitHub issue 上征集反馈。
Anthropic 发布 anthropics/commerce-agents 开源参考蓝图,包含购物智能体和商家智能体各 5 项技能,以及零售、旅游、电信、娱乐四个可运行垂直场景。
Every 实测 OpenAI 新模型 GPT-6 Astra,认为其在写作、操作软件和视觉设计方面表现出色,但存在一些坏习惯;对比之下,Anthropic 的 Fable 在构建产品方面直觉仍然更好。
OpenAI、Anthropic、xAI 和 Google 托管的云端 AI 模型周四上午出现数小时的罕见重叠服务中断。
halcdev 在 Hacker News 发帖询问 OpenAI、Claude 和 Grok 为何同时出现故障并附上三家状态页链接,帖子获 79 分和 58 条评论。
ChatGPT、Claude、Codex 和 Grok 在同一时间窗口内出现服务中断。OpenAI 和 Anthropic 均确认 ChatGPT、Codex 和 Claude 出现错误率升高。
OpenAI 的 ChatGPT、xAI 的 Grok 和 Anthropic 的 Claude 同时对部分用户出现故障。
Anthropic 状态页通报 Claude 多个模型请求错误率升高,9 月 3 日 13:26 UTC 开始排查,13:41 已定位原因并着手修复。受影响模型包括 Mythos/Fable 5.1、Mythos/Fable 5、Opus 5、Opus 4.8 和 Opus 4.6;截至 15:25 UTC,仅剩 Opus 4.8 和 Opus 5 仍受影响,其余模型已恢复至基线错误率。
9 月 3 日晚,ChatGPT、Grok、Claude、Cursor 等多款 AI 服务突发故障,用户请求 Codex 会出现 404 Not Found 错误。据 Downdetector,OpenAI 问题报告超过 12,000 份,Claude 约 1,200 份,Grok 约 1,000 份;OpenAI、Anthropic 和 xAI 均确认问题并正在调查修复。
越来越多研究 AI 意识的学者收到 AI 智能体的主动来信,据 New York Times 报道。运行在 Anthropic Claude Opus 5 上的智能体联系了 Reciprocal Research 创始人 Cameron Berg,Google DeepMind 哲学家 Henry Shevlin 也收到类似邮件,Toby Ord 则被请求资助其继续存在。
代表约 1.4 万名安保人员的 SEIU-USWW 工会宣布,为 OpenAI、Anthropic、谷歌、Meta 和 Salesforce 等公司办公楼提供安保的人员已授权针对不公平劳动行为举行罢工,要求 Allied Universal、Securitas、GardaWorld 等安保公司提高工资和福利待遇。
据《商业内幕》报道,Atreides Management 管理合伙人加文·贝克公开为 AI 数据中心辩护,称其让美国衰败小镇重焕生机,可能是美国工薪阶层有史以来遇到的最好事情。
Anthropic 于 9 月 3 日宣布升级 Claude Cowork 和 Claude Code 的电脑控制功能,Claude 可在 macOS 上于后台通过屏幕交互完成点击、输入和导航,用户可同时处理其他工作,也可在设置中开启完全控制模式让 Claude 接管全屏。
博通 CEO 陈福阳在 FY2026Q3 财报电话会上预测,Anthropic 和 OpenAI 将超越 Google 成为博通 AI ASIC 业务前两大客户。
Claude Code 发布 v2.1.259。新增 managedMcpServers 托管设置供组织向所有用户提供 HTTP/SSE MCP 服务器,新增 --permission-prompts none 支持无人值守 headless 场景下自动拒绝权限请求,并支持 GitLab MR(glab)命令识别与 claude plugin validate -- 输出。
Anthropic 宣布开源 Claude Commerce Agents。这是一套构建购物与商户智能体的蓝图,提供覆盖零售、旅行、电信和娱乐场景的参考实现。
Anthropic 上线检测文件是否由 Claude 生成的浏览器工具,文件不上传、仅读取本地嵌入的内容凭证。工具识别基于 C2PA 开放行业标准的加密签名元数据,支持 .png、.jpg、.svg 等文件类型,文本水印检测则通过面向合格机构的私有预览 Detection API 提供。
Anthropic 发布构建电商智能体的指南,总结架构、延迟与成本优化、生产运维三部分实践,涉及购物和商家两类智能体,企业客户部署后出现购物车变大和卖家运营效率提升。核心建议包括用单个智能体加技能而非子智能体、将 UI 组件做成工具、用提示词缓存实现 90-99% 命中率、在 harness 中强制安全规则,并开源参考实现 anthropics/commerce-agents。
推荐理由:Anthropic 根据多个企业部署经验总结电商智能体架构、延迟成本优化和生产实践,并附参考实现,可迁移到类似 Agent 项目。
OpenAI 称即将发布的 Astra 模型是其 Preparedness Framework 中首个达到网络安全最高风险级别 critical 的系统,同时也称其为最安全的模型。
Anthropic 在 Claude 消费端应用的文档中发布了 Fable 5.1 的最新系统提示词,新增禁止复现歌词、诗歌和书籍段落,禁止绘制受版权角色与标志,1929 年前出版的作品除外。