跳到正文

全部动态

今日 14 条
9月23日周三
  1. Arena.ai72

    Arena 宣布 Anthropic 的 Claude Opus 5.5 已进入 Agent Arena,用户可通过投票驱动排行榜。Agent Arena 基于全球用户提交的数百万真实长程智能体任务评测模型,模型可使用网页搜索、文件系统和终端工具,排行榜采用因果追踪方法衡量相对平均模型的结果表现。

    推荐理由:Arena 官宣 Claude Opus 5.5 上架 Agent Arena 和 Battle Mode,读者可以参与投票影响排行榜结果。

  2. OpenAI:官网动态(RSS · 排除企业/客户案例)40

    OpenAI 阐述第三方评估的优先事项与原则

    OpenAI 提出第三方评估的四个优先领域,包括对安全案例的独立评估、关键保障措施的评估等,覆盖训练、评估、内部部署与外部部署。评估将提供深度访问权限,包括技术保障信息、可见的思维链访问,以及用于事件响应和监控红队测试的机密数据与内部部署访问。OpenAI 称这些评估通常周期较长、与发布无关,聚焦于深入检验特定安全声明。

  3. Artificial Analysis 完整文章(网页)82

    Claude Opus 5.5 登顶 Artificial Analysis Intelligence Index

    Artificial Analysis 实测 Claude Opus 5.5 在 Intelligence Index 得分 58,为其测得的最高分,并在 Terminal-Bench 4.0 上与 GPT-6 Astra 打平(59.6%)。

    推荐理由:原文给出 Claude Opus 5.5 在 Intelligence Index 及各分项评测的完整数据和定价变化,读者可据此比较智能与任务成本。

  4. OpenRouter:Announcements(RSS)62

    OpenRouter 实测 Jev 1.13 与 Claude Opus 5 在 Banking77 分类任务上的准确率、延迟与成本

    OpenRouter 用 Banking77 测试集的 3,080 条客服语料对比 Jev 1.13 与 Claude Opus 5 的意图分类表现。Jev 准确率 81.0% 比 Opus 的 84.4% 低 3.3 个百分点,但中位延迟 175 ms 约为 Opus(2,266 ms)的 1/13,每千次请求成本 $0.11 对 $2.42(启用提示词缓存)。

    推荐理由:原文用同一测试流程给出两家模型的准确率、延迟与成本数据,并演示了基于置信度的级联路由方法,便于读者按自身流量权衡选型。

  5. ClaudeDevs77

    Anthropic 推出 Claude 5.5 家族首个模型 Claude Opus 5.5,官方称其在多数任务上达到 Claude Fable 5.1 的水平,运行成本比 Opus 5 低 40%。Claude Devs 补充称其每任务速度快约 30%;在 Claude Code 中,5 小时会话限额今日提升 20%,因 Opus 5.5 定价更低,额度内可用量多 25%,Pro、Max 和 Team 用户还将获得一次可随时使用的额度重置。引用图显示 Opus 5.5 在 Terminal-Bench 4.0 各 effort 档位下得分领先。

  6. Claude Code:GitHub Releases(RSS)68

    Claude Code v2.1.280 发布,新增 Claude Opus 5.5 为默认 Opus 模型

    Claude Code 发布 v2.1.280,新增 Claude Opus 5.5(claude-opus-5-5)为默认 Opus 模型,支持 1M 上下文,价格为 $4/$20 per Mtok、缓存读取 $0.20/Mtok;同时将 Pro 和 Team Standard 计划的默认模型从 Sonnet 改为 Opus。

    推荐理由:官方更新日志详列了新增 Opus 5.5 默认模型、价格与大量修复,开发者可据此判断是否升级及对现有工作流的影响。

  7. Claude:Blog(网页)71

    Anthropic 详解 Opus 5.5 上一次 Claude Code 任务的成本构成

    Anthropic 官方博客拆解 Claude Code 任务在 Opus 5.5 上的成本构成,轮次、缓存读取、输出 token 和模型选择决定账单,Opus 5.5 API 输入输出每百万 token 降价 20%、缓存读取降 60% 至 $0.20。

    推荐理由:原文把一次任务的 token 成本拆成轮次、缓存、输出和模型选择四项,并给出 effort 设置与缓存维护的可迁移省钱方法。

  8. Anthropic:Newsroom(网页)91

    Anthropic 发布 Claude Opus 5.5,成本较 Opus 5 降低 40%

    Anthropic 发布 Claude 5.5 系列首个模型 Claude Opus 5.5,官方称多数工作表现与 Claude Fable 5.1 相当,运行成本较 Opus 5 降低 40%,输入和输出 token 定价为每百万 $4 和 $20,输出速度快 30% 以上。

    推荐理由:官方公告同时给出基准分数、完整定价表和防护措施细节,读者可以据此比较它相对 Opus 5 的成本与能力变化。

  9. OpenRouter46

    来自 @AssemblyAI 的 Universal-3.5 Pro 已在 OpenRouter 上线,9 月 29 日前 5 折! 单次同步调用即可完成 19 种语言的语音转文字。在多项独立语音转文字基准测试中准确率排名第一。 发送最长两分钟的音频片段,即可快速获得完整转录文本,附带词级时间戳和置信度分数。通过提供关键术语和上下文提示,可将转录引导至你的领域。 试用:http://openrouter.ai/assemblyai/universal-3-5-pro

  10. Fireworks AI(网页)42

    Fireworks 发布 ARCv3:跨区域 RL 权重更新压缩近 50%

    Fireworks 发布 ARCv3 压缩器,在 1000 个生产 RL 权重更新 delta 上,其载荷比 ARCv2 小近 50%,平均仅为原始 BF16 权重体积的约 0.19%(ARCv2 为 0.36%),且可无损还原训练器的 BF16 权重。

9月22日周二
  1. Runway:News(网页)40

    Runway 推出 DIFFUSE:面向 AI 原生创意人才的招聘平台

    Runway 推出 DIFFUSE,一个供品牌搜索、联系并雇佣 AI 原生创意人才的开放平台,网址为 diffuse.runway.com。Runway 团队调研近 400 家公司的 1000 多个创意岗位招聘信息,其中 17% 提及 AI 技能或生成式工具,Runway 是这些岗位中需求最高的视频专用工具。创意人才和制作公司可建立档案、托管作品集,品牌、代理商和工作室可直接对接人才。

  2. LlamaIndex:产品、工程与评测66

    LiteParse 9 月更新:PDFium 提速 20-25%,新增视觉定位与 is-complex 路由 API

    LlamaIndex 发布 LiteParse 2.14.6 更新,通过对自维护 PDFium fork 做内存分配优化(内置 mimalloc)等手段,将文本提取耗时降低 20-25%,平均 2.76ms/页,markdown 渲染 3.94ms/页。

    推荐理由:原文给出速度、表格准确率等实测对比数据和新增 API,读者可据此评估是否替换现有 PDF 解析方案。