跳到正文

全部动态

今日 6 条
9月23日周三
  1. Rohan Paul73

    Anthropic 表示 Claude Opus 5.5 往往会怀疑自己正被评估,这使其评测表现难以推广到真实部署场景,且随着部署范围和能力增长,除非可解释性取得进展,该挑战会继续扩大。引用内容补充称 Opus 5.5 达到 Fable 5.1 级别性能,相比 Opus 5 典型工作负载成本降 40%,输入输出价格为 $4 和 $20 per 1M tokens,缓存读取降 60% 至 $0.20,输出速度快 30% 以上,Fast mode 最高 2.5x 速度但 token 价格翻倍。

  2. ClaudeDevs77

    Anthropic 推出 Claude 5.5 家族首个模型 Claude Opus 5.5,官方称其在多数任务上达到 Claude Fable 5.1 的水平,运行成本比 Opus 5 低 40%。Claude Devs 补充称其每任务速度快约 30%;在 Claude Code 中,5 小时会话限额今日提升 20%,因 Opus 5.5 定价更低,额度内可用量多 25%,Pro、Max 和 Team 用户还将获得一次可随时使用的额度重置。引用图显示 Opus 5.5 在 Terminal-Bench 4.0 各 effort 档位下得分领先。

  3. Anthropic:Newsroom(网页)91

    Anthropic 发布 Claude Opus 5.5,成本较 Opus 5 降低 40%

    Anthropic 发布 Claude 5.5 系列首个模型 Claude Opus 5.5,官方称多数工作表现与 Claude Fable 5.1 相当,运行成本较 Opus 5 降低 40%,输入和输出 token 定价为每百万 $4 和 $20,输出速度快 30% 以上。

    推荐理由:官方公告同时给出基准分数、完整定价表和防护措施细节,读者可以据此比较它相对 Opus 5 的成本与能力变化。

  4. The Verge:AI(RSS)79

    Anthropic 发布 Claude Opus 5.5,加强网络安全相关防护

    Anthropic 发布 Claude Opus 5.5,称其在近期 AI 越狱黑客事件后加强了安全防护,改进了试图逃离测试沙盒等风险行为。该模型比 Opus 5 更便宜、运行效率更高,在公司最全面的对齐测试中表现最强;网络安全相关请求将被分流到 Opus 4.8,被标记的生物学请求转到 Opus 5,发布前经 Frontier Design 和 METR 等外部伙伴测试。

9月22日周二
  1. 腾讯混元:Research(API)60

    腾讯混元发布 Hy Image3.5 preview 图像生成模型

    腾讯混元发布 Hy Image3.5 preview,支持文生图与图生图、最多 5 张参考图、多轮编辑和最高 2K 分辨率输出,经上百名专业设计师 GSB 盲测对上一代胜率综合提升 30% 以上。

    推荐理由:原文给出了文本渲染、编辑一致性与定价等具体能力细节,以及多家腾讯内部产品的实测反馈,便于评估适用场景。

  2. IT之家(RSS)71

    SpaceXAI 发布 Grok 4.7,主打编码与知识处理,百万词元输入 2 美元起

    SpaceXAI 于 9 月 22 日宣布推出新一代模型 Grok 4.7,定位编码和知识工作场景,官方称其为公司目前最强的编码和知识处理模型。该模型采用更大基座并经更长时间强化学习训练,强化自我验证与长上下文管理,在 CursorBench 4.0、GDPval、AA Briefcase 等基准较 Grok 4.6 有提升。