Anthropic 发布 Claude Haiku 5.5,价格对齐 GPT-6 Luna
Anthropic 发布快速低价模型 Claude Haiku 5.5,定价为每百万 token 输入 $0.10、输出 $0.50,与 OpenAI 上月发布的 GPT-6 Luna 一致,超过 100,000 token 后涨至 $0.50/$2.50。
推荐理由:作者实测对比 Haiku 5.5 与 GPT-6 Luna 的价格、tokenizer 与推理档位,给出可迁移的成本判断。
Anthropic 发布快速低价模型 Claude Haiku 5.5,定价为每百万 token 输入 $0.10、输出 $0.50,与 OpenAI 上月发布的 GPT-6 Luna 一致,超过 100,000 token 后涨至 $0.50/$2.50。
推荐理由:作者实测对比 Haiku 5.5 与 GPT-6 Luna 的价格、tokenizer 与推理档位,给出可迁移的成本判断。
Anthropic 发布 Claude Haiku 5.5,这是其目前最快、最便宜的小型模型,平均价格比 Haiku 4.5 低约 75%,10 万 token 以内提示词的价格降幅最高达 90%,超过 10 万 token 的提示词价格则是前者的五倍。
推荐理由:Haiku 5.5 的降价幅度与基准提升同时给出,读者可据此判断小型模型在成本敏感任务中的实际定位。
AWS 宣布 Claude Haiku 5.5 在 Amazon Bedrock 和 Claude Platform on AWS 上可用。
推荐理由:文章给出 Haiku 5.5 在 Bedrock 上的可用区域、成本变化与代码调用方式,便于判断它在多智能体分层中的位置。
Simon Willison 让 Claude Opus 5.5 为电脑游戏作曲,要求先设计简单的文本音乐格式,再构建可播放的 artifact 并附示例曲目,风格对标《猴岛小英雄》。结果模型比预期更贴近猴岛主题,成品质量出人意料地好。他猜测这种作曲能力可能类似文本模型的 3D 图形能力,是近几个月才涌现的新能力,但需用更多新旧模型做实验才能确认。
Mistral 发布迄今最大模型 Mistral Large 4,拥有 1 万亿参数、490 亿激活参数,已在 Mistral Studio 开放 API 预览,权重预计 10 月底发布。
Reflection AI 发布首款前沿开源权重模型 Beam,称其在高级推理基准上追平 Z.ai 的 GLM-5.2,并比当前领先的西方开源模型表现更好,推理算力用量少 3-4 倍。
OpenAI 发布 GPT-6.1 Sol,定价 $2/$10 per million input/output tokens,比 Astra 的 $10/$50 大幅降低;据称在 DeepSWE v1.1 上超 GPT-6 Sol 6.4 分、在 AutomationBench 上超 Opus 5.5 2.2 分。
Google 发布新一代前沿模型 Gemini 4 Argon,在 Artificial Analysis 智能指数上以 53 分追平 GPT-6 Astra(max)和 Claude Fable 5.1,但仍落后 Claude Opus 5.5 的 58 分。
推荐理由:汇总第三方与 Google 自测的基准、价格和 token 消耗差异,可判断 Argon 在头部模型中的实际位置。
Anthropic 发布对智谱 GLM-5.3 网络攻击能力的分析,发现其可自主开发端到端漏洞利用,在 ExploitBench 410 次尝试中成功 50 次,接近 Claude Mythos Preview 的 56 次。
推荐理由:Anthropic 第一手评测给出 GLM-5.3 的漏洞利用成功率和防护绕过数据,读者可据此了解开放权重模型带来的攻击面变化。
作者实测 Anthropic 新发布的 Claude Sonnet 5.5,用代码动画、HTML PPT、3D 网页和写作四项任务对比 Opus 5.5 与 gpt6。
Anthropic 发布 Claude Sonnet 5.5,是 Claude 5.5 家族第二款模型,定位为 Opus 5.5 更快更省的补充,已在 Claude Platform、AWS、Google Cloud 和 Azure 上线。
Arena 于 9 月 26 日分析 Text Arena 高推理回复,发现 Claude Opus 5.5 相比 Opus 5 破折号使用量下降约 95%(每 1,000 个单词从 15.2 个降至 0.8 个),分号下降 73%(从 6.10 个降至 1.64 个)。
Anthropic 的 Claude Opus 5.5 本周发布,社区反馈以正面为主,尤其擅长生成讲解视频。它在 SimpleBench 上以 88.4% 领先,在 Terminal-Bench-Science 上推理强度从 low 的 24% 升到 xhigh 的 62%,max 档反而降到 59%。
Anthropic 发布中端模型 Claude Sonnet 5.5,官方称速度比上一代提升 30%,Token 消耗速度明显更低,定位为编写代码和制作办公文档等日常任务的助手。
Anthropic 发布 Claude Sonnet 5.5,官方称其运行快 30% 以上,多数工作成本最多低 30%,定价与 Sonnet 5 相同但在各项基准上表现更好。
一组 Claude Sonnet 5.5 的早期实验。 @_re_pete 用 Sonnet 5 与 Sonnet 5.5 制作的秋叶模拟器对比。
Anthropic 于今日发布 Sonnet 5.5,定位为比 Sonnet 5 更强的协作模型,但需要用户保持掌控并在适当时机调用 Opus。该模型是 Claude 拥挤家族中的新成员,具体参数与基准数据尚未披露。
Artificial Analysis 发布对 Claude Sonnet 5.5 的评测:其智能指数得分 56,max effort 下比 Sonnet 5 高 18 分,升至第 2 名,仅落后 Opus 5.5 (max)。
推荐理由:Artificial Analysis 实测指出 Sonnet 5.5 逼近 Opus 5.5 依赖约 193k 输出 token,成本细节对选型有直接参考价值。
Anthropic 的 Claude Sonnet 5.5 上线 OpenRouter。原文称其明显比 Sonnet 5 更聪明、写作更清晰,且对多数工作负载快约 30%、便宜约 30%。
AWS 宣布 Claude Sonnet 5.5 在 Amazon Bedrock 和 Claude Platform on AWS 上线,定位为面向编码与知识工作的更高效 Sonnet 模型,多数任务单任务成本更低、速度更快。
推荐理由:AWS 官方给出 Sonnet 5.5 的定位、与 Opus 5.5 的分工以及 Bedrock 上的调用方式,便于判断何时选用。
Anthropic 发布 Claude Sonnet 5.5,输出速度提升超过 30%,因每任务消耗 token 更少,有效成本最多降低 30%,多项基准接近 Opus 5.5。
推荐理由:Arena 介绍了其 Agent Arena 的评测方式,读者可以据此理解 Claude Sonnet 5.5 在真实智能体任务上的衡量口径。
推荐理由:Artificial Analysis 用自家基准拆解了性能与 token 成本的权衡,为选型提供了可对比的量化参考。
Anthropic 发布 Claude Sonnet 5.5,称为 Claude 5.5 家族的第二款模型,相比 Sonnet 5 是明显升级,运行速度提升超过 30%,多数工作成本最多降低 30%。
Anthropic 发布中端模型 Sonnet 5.5,官方称其比前代 Sonnet 5 快 30%,token 消耗明显更低。公司基准显示该模型在 agentic 编码上优于 Opus 5.5,并称其具备与 Opus 5 相当的网络安全能力,因此成为首个适用与 Fable 和 Opus 相同网络安全防护的 Sonnet 模型;公司还计划在未来几周发布新版本 Haiku。
Anthropic 发布 Claude Sonnet 5.5,为 Claude 5.5 家族第二款模型,生成速度比 Sonnet 5 快 30% 以上,每任务成本最多低 30%,定价维持每百万输入 token $2、输出 $10、缓存读取 $0.20。
Anthropic 发布 Claude Sonnet 5.5,运行速度比 Sonnet 5 快 30% 以上,写作更清晰,适合快速来回交互。定位上与为复杂判断工作打造的 Claude Opus 5.5 区分,Sonnet 5.5 擅长范围明确的日常任务、修复 bug 以及制作文档、幻灯片和表格。模型即日起全量可用,Claude Haiku 5.5 将在未来几周加入该系列。
Anthropic 发布 Claude Sonnet 5.5,运行速度比 Sonnet 5 快超过 30%,写作更清晰,适合快速往复的日常任务。官方称其擅长修复 bug、制作文档、幻灯片和表格并有较强设计感,而 Claude Opus 5.5 面向需要谨慎判断的复杂工作;Sonnet 5.5 即日起全面可用,Claude Haiku 5.5 将在未来几周加入该系列。
Arena 公布 Claude Opus 5.5 (High) 进入 Agent Arena 排名第 2,净改进分 +12.15%,仅次于 Fable 5.1 (Max)。
推荐理由:榜单给出了 Claude Opus 5.5 (High) 在 Agent Arena 的排名、价格与分项信号,读者可据此权衡它与 Opus 5 各档的成本与能力变化。