跳到正文

#Anthropic

今日 3 条
今天10月8日周四
  1. The Decoder80

    Anthropic 发布 Claude Haiku 5.5,价格最高下调 90%

    Anthropic 发布 Claude Haiku 5.5,这是其目前最快、最便宜的小型模型,平均价格比 Haiku 4.5 低约 75%,10 万 token 以内提示词的价格降幅最高达 90%,超过 10 万 token 的提示词价格则是前者的五倍。

    推荐理由:Haiku 5.5 的降价幅度与基准提升同时给出,读者可据此判断小型模型在成本敏感任务中的实际定位。

10月6日周二
  1. Simon Willison20

    Simon Willison 测试 Claude Opus 5.5 作曲能力:结果出人意料地好

    Simon Willison 让 Claude Opus 5.5 为电脑游戏作曲,要求先设计简单的文本音乐格式,再构建可播放的 artifact 并附示例曲目,风格对标《猴岛小英雄》。结果模型比预期更贴近猴岛主题,成品质量出人意料地好。他猜测这种作曲能力可能类似文本模型的 3D 图形能力,是近几个月才涌现的新能力,但需用更多新旧模型做实验才能确认。

10月3日周六
10月2日周五
9月30日周三
  1. Anthropic:Research(发表成果 · 网页)81

    Anthropic 评测 GLM-5.3:能自主构建端到端网络漏洞利用且防护易被绕过

    Anthropic 发布对智谱 GLM-5.3 网络攻击能力的分析,发现其可自主开发端到端漏洞利用,在 ExploitBench 410 次尝试中成功 50 次,接近 Claude Mythos Preview 的 56 次。

    推荐理由:Anthropic 第一手评测给出 GLM-5.3 的漏洞利用成功率和防护绕过数据,读者可据此了解开放权重模型带来的攻击面变化。

9月29日周二
  1. Arena.ai69

    Arena 宣布 Anthropic 的 Claude Sonnet 5.5 已进入 Agent Arena,并开放投票。Agent Arena 基于全球用户数百万个真实的长程智能体任务评测模型,模型可使用 web search、filesystem 和 terminal 工具完成复杂工作流,榜单用因果追踪方法衡量模型相对平均模型的结果表现。

    推荐理由:Arena 介绍了其 Agent Arena 的评测方式,读者可以据此理解 Claude Sonnet 5.5 在真实智能体任务上的衡量口径。

  2. TechCrunch:AI(RSS)71

    Anthropic 发布 Sonnet 5.5,称其比前代更快更便宜

    Anthropic 发布中端模型 Sonnet 5.5,官方称其比前代 Sonnet 5 快 30%,token 消耗明显更低。公司基准显示该模型在 agentic 编码上优于 Opus 5.5,并称其具备与 Opus 5 相当的网络安全能力,因此成为首个适用与 Fable 和 Opus 相同网络安全防护的 Sonnet 模型;公司还计划在未来几周发布新版本 Haiku。

  3. Claude:YouTube(RSS)67

    Anthropic 发布 Claude Sonnet 5.5,速度比 Sonnet 5 快超 30%

    Anthropic 发布 Claude Sonnet 5.5,运行速度比 Sonnet 5 快 30% 以上,写作更清晰,适合快速来回交互。定位上与为复杂判断工作打造的 Claude Opus 5.5 区分,Sonnet 5.5 擅长范围明确的日常任务、修复 bug 以及制作文档、幻灯片和表格。模型即日起全量可用,Claude Haiku 5.5 将在未来几周加入该系列。

  4. Claude:YouTube(RSS)65

    Anthropic 发布 Claude Sonnet 5.5,速度比 Sonnet 5 快逾 30%

    Anthropic 发布 Claude Sonnet 5.5,运行速度比 Sonnet 5 快超过 30%,写作更清晰,适合快速往复的日常任务。官方称其擅长修复 bug、制作文档、幻灯片和表格并有较强设计感,而 Claude Opus 5.5 面向需要谨慎判断的复杂工作;Sonnet 5.5 即日起全面可用,Claude Haiku 5.5 将在未来几周加入该系列。