跳到正文

#评测/基准

今日 1 条
9月25日周五
  1. HuggingFace Daily Papers(社区热门论文)55

    TRACE:流式视频理解的时序审计与条件感知评估框架

    论文提出 TRACE 基准,旨在解决现有流式视频理解评估中忽略证据时效性、历史维护及响应触发机制的问题。该框架通过统一因果协议控制信息可用性,并多维报告答案质量、及时性、负载等指标。在 1240 条记录上的实验显示,相似的 QA 准确率可能掩盖系统在完成度、生成负载及主动响应行为(如误报、漏报)上的巨大差异,强调应将性能视为执行条件下的系统行为而非单一分数。

  2. Artificial Analysis 完整文章(网页)40

    Artificial Analysis 发布 Cyber Index 网络安全评估联盟

    Artificial Analysis 推出 Cyber Index,整合 CWE-Bench-AA、DeepsecBench-AA 和 CyberGym-E2E-AA 三项评估,覆盖从代码审计、漏洞发现到复现与修补的防御全流程。该指数基于 Stirrup 开源代理框架运行,重点测试模型在拥有源代码访问权限下的漏洞识别与修复能力,并单独记录因安全原因拒绝任务的情况。目前暂不包含利用漏洞生成攻击载荷的能力评估。

9月24日周四
  1. 公众号:卡尔的AI沃茨62

    五大场景实测商汤SenseNova U1 Pro:从审美到多图融合的生图能力评测

    商汤上线SenseNova U1 Pro,在8月SuperCLUE-Image中文文生图榜单以总分93.81排名第一,作者实测其与gpt image 2.5对比。作者分审美与中文版式、多文字运营物料、资料检索与高密度信息、局部修图、多图融合五类任务测试,附全部提示词,认为其文字稳定、局部编辑精准、可支持8K输出,整体完成度达到可交付水平,考虑替换进自己的图片工作流。

  2. HuggingFace Daily Papers(社区热门论文)50

    IndicBankBench:评估印度零售银行语言模型助手的安全性与可靠性

    研究推出 IndicBankBench,一个包含799个案例的印度零售银行基准测试,涵盖五个操作域及能力/拒绝域。该基准在安全、行动与工具使用、响应充分性及建议质量四个阶段进行评估,采用确定性检查结合LLM裁判。对11个模型的测试显示,严格通过率(pass^3)仅为43.7%至58.2%,远低于至少一次成功率的60%-74%,揭示了现有评估可能高估了银行场景下的可靠行为。数据集与评估框架已开源。

  3. The Verge:AI(RSS)61

    Meta AI 智能体 Muse 评测:擅长花钱的可爱助手

    The Verge 作者实测 Meta 的 AI 智能体 Muse,用它处理五项拖延已久的琐事,包括跟进园林报价、购买咖啡机零件、取消安保套餐和采购露营装备。多数任务能完成,但无法打电话改套餐,访问 Amazon 也被拦截;40 分钟内作者已交出姓名、地址、信用卡和安全账户凭据,且发现高效完成后反而腾出时间与机器人闲聊。

9月23日周三
  1. METR:Blog(网页)62

    METR 发布 Claude Opus 5.5 部署前评估摘要

    METR 发布对 Claude Opus 5.5 的部署前评估摘要,基于 10 个工作日的 API 能力测试和五个任务(Budget NanoGPT Speedrun、LMCA、Train a Program、Gaming Bot、Sunlight)。

    推荐理由:METR 作为第三方评估方给出了 Claude Opus 5.5 在 AI 研发加速上的量化结论,读者可据此了解部署前评估的证据基础与判断边界。

  2. Arena.ai72

    Arena 宣布 Anthropic 的 Claude Opus 5.5 已进入 Agent Arena,用户可通过投票驱动排行榜。Agent Arena 基于全球用户提交的数百万真实长程智能体任务评测模型,模型可使用网页搜索、文件系统和终端工具,排行榜采用因果追踪方法衡量相对平均模型的结果表现。

    推荐理由:Arena 官宣 Claude Opus 5.5 上架 Agent Arena 和 Battle Mode,读者可以参与投票影响排行榜结果。

  3. Artificial Analysis 完整文章(网页)82

    Claude Opus 5.5 登顶 Artificial Analysis Intelligence Index

    Artificial Analysis 实测 Claude Opus 5.5 在 Intelligence Index 得分 58,为其测得的最高分,并在 Terminal-Bench 4.0 上与 GPT-6 Astra 打平(59.6%)。

    推荐理由:原文给出 Claude Opus 5.5 在 Intelligence Index 及各分项评测的完整数据和定价变化,读者可据此比较智能与任务成本。

  4. OpenRouter:Announcements(RSS)62

    OpenRouter 实测 Jev 1.13 与 Claude Opus 5 在 Banking77 分类任务上的准确率、延迟与成本

    OpenRouter 用 Banking77 测试集的 3,080 条客服语料对比 Jev 1.13 与 Claude Opus 5 的意图分类表现。Jev 准确率 81.0% 比 Opus 的 84.4% 低 3.3 个百分点,但中位延迟 175 ms 约为 Opus(2,266 ms)的 1/13,每千次请求成本 $0.11 对 $2.42(启用提示词缓存)。

    推荐理由:原文用同一测试流程给出两家模型的准确率、延迟与成本数据,并演示了基于置信度的级联路由方法,便于读者按自身流量权衡选型。

9月22日周二
  1. 公众号:数字生命卡兹克72

    卡兹克实测对比 Grok 4.7 与小米 MiMo V2.6:后者成不可能三角版本答案

    作者实测同日凌晨发布的 Grok 4.7 与小米 MiMo V2.6,认为 Grok 4.7 低于预期,MiMo V2.6 成为性能、价格、速度三角的当前版本答案。

    推荐理由:作者亲手测试并给出价格、速度和基准对比,读者可以据此评估小米 MiMo V2.6 对自身工作流和成本的实际影响。

  2. Artificial Analysis65

    Artificial Analysis 评测阶跃星辰 Step 5 Preview,其在 Artificial Analysis Intelligence Index 得 44 分,与 Kimi K3 (max) 持平,略低于 GLM-5.3 (max) 和 Qwen3.8 Max 的 45 分,每任务成本约 $0.72,约为同级模型(约 $2.00)的 1/2.8。

    推荐理由:Artificial Analysis 实测 Step 5 Preview 的得分、成本与智能体短板,读者可据此对比同分段模型的表现与性价比。

  3. Artificial Analysis 完整文章(网页)68

    Artificial Analysis 评测 Grok 4.7:智能指数 46 分进入前四,编码智能体升至第 4

    Artificial Analysis 发布 Grok 4.7 评测,Grok 4.7(xhigh)智能指数得 46 分,较 Grok 4.6 高 2 分,使 SpaceXAI 进入前四;搭配 Grok Build 的编码智能体指数从 47 升至 56,仅次于 Claude Fable 5.1、GPT-6 Astra 和 Claude Opus 5。

    推荐理由:评测方给出 Grok 4.7 在多项基准的具体分数、token 消耗与对比对象,读者可据此判断其真实水平与成本。