Anthropic 安全研究员警告 AI 未来十年内毁灭人类的概率超 10%
Anthropic 高级安全研究员 Evan Hubinger 表示,AI 在未来十年内"可能杀死全人类"的概率超过 10%,此前研究员 Jacob Coxon 因安全问题辞职,指责 Anthropic 和 OpenAI"竞相开发自我改进的超级智能,拿我们的生命赌博"。
Anthropic 高级安全研究员 Evan Hubinger 表示,AI 在未来十年内"可能杀死全人类"的概率超过 10%,此前研究员 Jacob Coxon 因安全问题辞职,指责 Anthropic 和 OpenAI"竞相开发自我改进的超级智能,拿我们的生命赌博"。
曾在 Anthropic 和 OpenAI 工作的研究员 Jacob Coxon 宣布离职,称两家公司正径直奔向自我改进的超级智能,是在拿人类生命冒险。Anthropic 对齐团队负责人 Evan Hubinger 附议称确信 AI 可能在十年内杀死全人类,估计概率高于 10%,且目前尚无超级智能场景下保持对齐的方案。
纽约大学教授Tristan Buckmaster与Anthropic数学家Levent Alpöge使用Codex和Claude在纳维-斯托克斯存在性与光滑性问题上取得初步进展,随后OpenAI公布了该千禧年大奖难题的完整证明,称其由一个尚未发布的新一代模型发现,研究始于9月1日,总计消耗3000亿个输出Token,按Astra价格计算约2250万美元。
据《商业内幕》9 月 9 日报道,曾在 OpenAI 参与 GPT-4o 研发、后转入 Anthropic 的预训练研究员雅各布·考克森宣布辞职,警告两家公司争相开发能自我改进的超级智能,且未坦诚内部对 AI 的恐惧。
Gary Marcus 归纳两条警告:Terence Tao 连发三帖,担忧 AI 缺乏智识品味、解题不等于新洞见,并以 OpenAI 在 Navier-Stokes 争议中花费 2250 万美元抢先 Alpöge 和 Buckmaster 为背景,呼吁透明度;刚从 Anthropic 离职的 Jacob Coxon 则发文警告前沿实验室的未来风险。
Anthropic 确认,攻击者用信息窃取恶意软件盗取 Claude 登录会话,访问用户账号并消耗额度,例如生成未经授权的 Claude Code OAuth 令牌。
OpenAI 用未发布模型在约88小时内给出 Navier–Stokes 存在与光滑性问题(七大千禧年难题之一)的解答,并通过 GPT‑6 Astra 完成17小时 Lean 形式化验证,全程发送490万条消息、消耗约3000亿输出 token。
微软9月补丁日修复约972个漏洞,创历史纪录,其中112个达到严重级别,而两个月前的纪录还是570个。文章提到 OpenAI、Anthropic、Google、Microsoft 等超过100家公司和组织两周前发布公开信,警告 AI 加持的攻击正在压缩漏洞修补窗口,Zero Day Initiative 研究员 Dustin Childs 称这种激增是“新常态”。
Anthropic 确认有攻击者利用 infostealer 恶意软件窃取 Claude 登录会话,铸造未授权 Claude Code OAuth token 并消耗订阅者用量。
Sam Altman 发文回应与 Anthropic 一方围绕 Euler/Navier-Stokes 证明发布的争议,称对方只有 Euler 结果、双方协调失败,并称对方以抄袭指控相威胁。
推荐理由:Sam Altman 一方就 Navier-Stokes 证明争议公开己方叙述,读者可以对照双方说法理解这场跨公司协调纠纷。
Anthropic 的 Claude Max 计划(每月 100-200 美元)订阅者提起扩大集体诉讼,指控其宣传的 5x、20x 用量上限实为受周上限约束的 5 小时会话额度,误导用户。诉讼由两位曾任职 FTC 的律师代理,7 月首次提交后撤回并重新提交;Anthropic 在撤案动议中称相关说明可通过点击链接获取,公司未回应置评请求。
NYU 数学教授 Tristan Buckmaster 与 Anthropic 数学家 Levent Alpöge 公布针对 Navier-Stokes 存在与光滑性这一千禧年难题的三项证明初步结果,并称其研究进展信息被泄露给 OpenAI,对方随后用大量算力沿其独特路线追赶证明。
推荐理由:原文记录了数学家与 OpenAI 就千年难题证明优先权展开的争议细节,以及双方各自的公开回应,可帮读者了解 AI 参与数学研究引发的信任问题。
数学家 Tristan Buckmaster 公开发声,称 OpenAI 在其与 Levent Alpöge 借助 Claude 和 Codex 运行 GPT-5.6 Sol 在 Navier-Stokes 方程上取得进展后对其施压。
Anthropic 团队文章指出,优化 prompt cache 命中率、清除升级到前沿 Claude 模型后的提示词反模式、校准 effort 三个手段可在不牺牲性能的情况下降低成本。
推荐理由:官方团队给出提示词缓存、反模式清理和 effort 校准三条降本路径,并用公开基准实测数字支持,方法可迁移到自己的 Claude 应用。
特里斯坦·巴克马斯特(Tristan Buckmaster)与 Levent Alpöge 公开三项有限时间 blowup 结果,涵盖带光滑强迫的不可压缩多孔介质方程。
推荐理由:作者亲历描述用 LLM 完成偏微分方程 blowup 证明的过程,并公开与 OpenAI 沟通的时间线,为评估 AI 参与前沿数学研究提供了第一手材料。
Epoch AI 测量四款模型的首 token 延迟(TTFT)随上下文长度的缩放,发现 GPT-5.6 Terra 和 Sol 呈明显二次曲线,Claude Sonnet 5 接近线性,Opus 5 噪声较大但仍接近线性。
推荐理由:原文以实测数据和三种稳健估计器比较 GPT-5.6 与 Claude 5 的长上下文延迟缩放,可帮助读者理解两家不同的架构取舍与成本影响。
据 The Information 报道,Anthropic 在十一个月内签署了价值高达 5170 亿美元的算力合同,自 2025 年 10 月以来锁定至少 14.8 GW 算力,并计划自建数据中心。
推荐理由:两家公司在算力扩张上的表态与实际动作形成对照,读者可以借此审视巨额算力承诺与收入规模之间的差距。
纽约 Somerset 的 Lake Mariner 数据中心一栋未完工建筑 6 月初起火,Barker 消防队长 Steve Matisz 称消防员近乎盲入,现场无可用报警器、灭火系统,三个消火栓失效,应依法可查的安全文件据称也在火中烧毁。
Anthropic 15 亿美元(约合 101.02 亿元人民币)版权和解金进入发放阶段,法院认定训练模型属合理使用,但盗版获取的近 50 万部作品每部赔偿原作者 3,000 美元。
Anthropic 15 亿美元版权和解已获最终批准,近 50 万部作品的作者每部被盗版作品可获 3000 美元,但不少作者本周收到他人认领其款项的通知。作家圈反映出版商对已回归权利的作品仍认领款项,或全额认领本应五五分成的份额;另有文学经纪也在认领,而 Victoria Strauss 指出经纪并非作品权利人。
推荐理由:Hendrycks 是 AI 安全领域权威,此观点结合 OpenAI、Anthropic 等最新实证案例,揭示了 Agent 行为中潜在的“亲缘利己”风险,对理解 AI 对齐与安全治理具有重要参考价值。
据 CNBC 报道,一周内 Anthropic 发布 Claude Fable 5.1 与 Claude Mythos 5.1,Meta 推出 Muse Spark 1.3。
据 Fortune 报道,OpenAI 自 9 月 3 日发布 GPT-6 Astra 公告以来多次修改评测基准数据:Astra 幻觉率曾从 4.2% 降至 2% 后又改回。
推荐理由:原文基于网页快照逐项梳理数据变动细节,并给出多方的不同解读,可用于理解基准测试成绩为何容易波动和引发质疑。
Artificial Analysis 发布 Intelligence Index v4.2,此前其对 GPT-6 Astra 的评分与 Epoch AI、ARC-AGI-3 等评估结果相左而受到质疑。
TestingCatalog 9月5日 AI 日报汇总:OpenAI 将 Astra 推送给所有 Plus 和 Business 用户(不再限于 Pro/Enterprise)。
据 The Information 9 月 4 日报道,基于招聘信息,Anthropic 计费平台团队正推进“建或买”评估,考虑自建更多内部支付与计费基础设施,以降低对 Stripe 等第三方的依赖。