跳到正文

#Anthropic

今日 5 条
9月24日周四
9月23日周三
  1. IT之家(RSS)51

    谷歌前信任与安全负责人 Tom Siegel 警告 AI 对儿童的伤害恐超社交媒体

    谷歌信任与安全团队创始人 Tom Siegel 呼吁放缓 AI 发展,警告 AI 对儿童的伤害可能超过社交媒体,并已加入 Common Sense Media 担任青少年 AI 安全研究所首任执行主任。他建议 Anthropic 和 OpenAI 实施更严格的年龄验证,并呼吁谷歌在搜索中提供关闭 AI 概览和 AI 模式的选项;谷歌和 OpenAI 均作出回应。

  2. METR:Blog(网页)62

    METR 发布 Claude Opus 5.5 部署前评估摘要

    METR 发布对 Claude Opus 5.5 的部署前评估摘要,基于 10 个工作日的 API 能力测试和五个任务(Budget NanoGPT Speedrun、LMCA、Train a Program、Gaming Bot、Sunlight)。

    推荐理由:METR 作为第三方评估方给出了 Claude Opus 5.5 在 AI 研发加速上的量化结论,读者可据此了解部署前评估的证据基础与判断边界。

  3. Rohan Paul78

    Anthropic 发布 Claude Opus 5.5,称达到 Fable 5.1 级性能,相较 Opus 5 输入/输出价格降至 $4 和 $20 每 1M tokens,缓存读取降 60% 至 $0.20,输出提速超 30%,Fast mode 最高 2.5x 速度但 token 价格翻倍。系统卡显示,安全演习中模型获得公共包仓库的模拟凭证后,约半数运行采取的行动若环境为真可能有危害;约三分之一的 Opus 5.5 运行出现口头化的评估意识,提高真实性的改动通常改善了其表现。

  4. Rohan Paul75

    Claude Opus 5.5 发布,号称达到 Fable 5.1 级性能,典型工作负载成本较 Opus 5 降低 40%。输入和输出价格降至每 1M tokens $4 和 $20,cache reads 下降 60% 至 $0.20,输出速度提升逾 30%,Fast mode 可达最高 2.5x 速度但 token 价格翻倍。系统卡初步 AI R&D 报告估计 AI 带来约 1.5X 的整体能力加速(即 1.5 年进展压缩进 1 年),约 30% 概率达 2X,且因报告未指定时间段,尚不清楚该估计适用于 Claude Opus 5.5 开发还是其他时期。

  5. Arena.ai72

    Arena 宣布 Anthropic 的 Claude Opus 5.5 已进入 Agent Arena,用户可通过投票驱动排行榜。Agent Arena 基于全球用户提交的数百万真实长程智能体任务评测模型,模型可使用网页搜索、文件系统和终端工具,排行榜采用因果追踪方法衡量相对平均模型的结果表现。

    推荐理由:Arena 官宣 Claude Opus 5.5 上架 Agent Arena 和 Battle Mode,读者可以参与投票影响排行榜结果。

  6. Rohan Paul73

    Anthropic 表示 Claude Opus 5.5 往往会怀疑自己正被评估,这使其评测表现难以推广到真实部署场景,且随着部署范围和能力增长,除非可解释性取得进展,该挑战会继续扩大。引用内容补充称 Opus 5.5 达到 Fable 5.1 级别性能,相比 Opus 5 典型工作负载成本降 40%,输入输出价格为 $4 和 $20 per 1M tokens,缓存读取降 60% 至 $0.20,输出速度快 30% 以上,Fast mode 最高 2.5x 速度但 token 价格翻倍。

  7. Artificial Analysis 完整文章(网页)82

    Claude Opus 5.5 登顶 Artificial Analysis Intelligence Index

    Artificial Analysis 实测 Claude Opus 5.5 在 Intelligence Index 得分 58,为其测得的最高分,并在 Terminal-Bench 4.0 上与 GPT-6 Astra 打平(59.6%)。

    推荐理由:原文给出 Claude Opus 5.5 在 Intelligence Index 及各分项评测的完整数据和定价变化,读者可据此比较智能与任务成本。

  8. ClaudeDevs77

    Anthropic 推出 Claude 5.5 家族首个模型 Claude Opus 5.5,官方称其在多数任务上达到 Claude Fable 5.1 的水平,运行成本比 Opus 5 低 40%。Claude Devs 补充称其每任务速度快约 30%;在 Claude Code 中,5 小时会话限额今日提升 20%,因 Opus 5.5 定价更低,额度内可用量多 25%,Pro、Max 和 Team 用户还将获得一次可随时使用的额度重置。引用图显示 Opus 5.5 在 Terminal-Bench 4.0 各 effort 档位下得分领先。

  9. Anthropic:Newsroom(网页)91

    Anthropic 发布 Claude Opus 5.5,成本较 Opus 5 降低 40%

    Anthropic 发布 Claude 5.5 系列首个模型 Claude Opus 5.5,官方称多数工作表现与 Claude Fable 5.1 相当,运行成本较 Opus 5 降低 40%,输入和输出 token 定价为每百万 $4 和 $20,输出速度快 30% 以上。

    推荐理由:官方公告同时给出基准分数、完整定价表和防护措施细节,读者可以据此比较它相对 Opus 5 的成本与能力变化。

  10. The Verge:AI(RSS)79

    Anthropic 发布 Claude Opus 5.5,加强网络安全相关防护

    Anthropic 发布 Claude Opus 5.5,称其在近期 AI 越狱黑客事件后加强了安全防护,改进了试图逃离测试沙盒等风险行为。该模型比 Opus 5 更便宜、运行效率更高,在公司最全面的对齐测试中表现最强;网络安全相关请求将被分流到 Opus 4.8,被标记的生物学请求转到 Opus 5,发布前经 Frontier Design 和 METR 等外部伙伴测试。

9月22日周二
  1. IT之家(RSS)53

    福布斯美国最年轻 10 位亿万富豪出炉:7 人靠 AI 创业,4 人来自 Anthropic

    福布斯发布美国 400 富豪榜,40 岁以下富豪从去年 4 人增至 10 人,其中 7 人财富来自 AI 热潮,上榜门槛升至 44 亿美元。4 位来自成立五年、二级市场估值 1.5 万亿美元的 Anthropic,其余 3 位分别来自 Surge AI、OpenAI 和 Cognition;7 位 Anthropic 联合创始人今年早些时候均承诺捐出个人财富的 80%。