Arena 宣布 Grok 4.7 (xHigh) 进入 Agent Arena 榜单第16位,净改进分 +3.96%。
#评测/基准
#评测/基准
今日 1 条
Arena.ai@arenaAI 评分5656HuggingFace Daily Papers(社区热门论文)AI 评分5555 TRACE:流式视频理解的时序审计与条件感知评估框架
论文提出 TRACE 基准,旨在解决现有流式视频理解评估中忽略证据时效性、历史维护及响应触发机制的问题。该框架通过统一因果协议控制信息可用性,并多维报告答案质量、及时性、负载等指标。在 1240 条记录上的实验显示,相似的 QA 准确率可能掩盖系统在完成度、生成负载及主动响应行为(如误报、漏报)上的巨大差异,强调应将性能视为执行条件下的系统行为而非单一分数。
HuggingFace Daily Papers(社区热门论文)AI 评分4545 Duplex-MPE:全双工对话中多方交互的基准测试
Duplex-MPE 基准发布,用于评估全双工语音助手在多人共享对话中何时应答、保持沉默或停止说话,包含 2000 个由三到四名人类说话者与一名助手构成的场景,同一请求分显式与隐式指代配对。
Arena.ai@arenaAI 评分6161The Decoder:AI News(RSS)AI 评分6666 研究显示 AI 基准性能成本每年降至约十三分之一,MIT 估算纯算法效率约每年 3 倍
Epoch AI 估算,在固定基准分数上取得同等性能的市场价格平均每季度下降约 47%,约合每年 13 倍。OpenAI 的 o3 在 2025 年初以每题约 30 美分在 GPQA Diamond 达到 75% 准确率,18 个月后 GPT-5.6 系列模型以原价 1/725 达到同样分数。
Artificial Analysis 完整文章(网页)AI 评分4040 Artificial Analysis 发布 Cyber Index 网络安全评估联盟
Artificial Analysis 推出 Cyber Index,整合 CWE-Bench-AA、DeepsecBench-AA 和 CyberGym-E2E-AA 三项评估,覆盖从代码审计、漏洞发现到复现与修补的防御全流程。该指数基于 Stirrup 开源代理框架运行,重点测试模型在拥有源代码访问权限下的漏洞识别与修复能力,并单独记录因安全原因拒绝任务的情况。目前暂不包含利用漏洞生成攻击载荷的能力评估。
Hacker News:AI 热帖AI 评分6464 按预算挑选最优 LLM 的每日更新对照表
作者 terryds 上线 bestmodelforyourbudget 网站,每日用 Artificial Analysis 免费 API 数据更新按预算选 LLM 的对照表。
Arena.ai@arenaAI 评分6868公众号:卡尔的AI沃茨AI 评分6262 五大场景实测商汤SenseNova U1 Pro:从审美到多图融合的生图能力评测
商汤上线SenseNova U1 Pro,在8月SuperCLUE-Image中文文生图榜单以总分93.81排名第一,作者实测其与gpt image 2.5对比。作者分审美与中文版式、多文字运营物料、资料检索与高密度信息、局部修图、多图融合五类任务测试,附全部提示词,认为其文字稳定、局部编辑精准、可支持8K输出,整体完成度达到可交付水平,考虑替换进自己的图片工作流。
公众号:卡尔的AI沃茨AI 评分7171 实测GPT-6 Sol、Luna与Claude Opus 5.5:编程、前端、写作与3D多模态对比
作者实测GPT-6 Sol、Luna与Claude Opus 5.5三款新模型。GPT-6 Sol/Luna API价格比GPT5.6低50%,Opus 5.5输出速度比Opus5快30%、成本低40%,并提升了pro、max、team套餐的五小时额度窗口。
公众号:卡尔的AI沃茨AI 评分7474 实测小米 MiMo-V2.6 系列模型:开源分第一,价格低至同级海外模型的几十分之一
小米发布 MiMo-V2.6-Pro、Flash 和 Pro-UltraSpeed 三款模型,UltraSpeed 输出速度最高达 Pro 的 20 倍。
Artificial Analysis@ArtificialAnlys精选AI 评分6868推荐理由:原文给出 Opus 5.5 在三项编码评测的具体分数、token 用量和任务成本,读者可以据此权衡性能与价格。
Hacker News:AI 热帖AI 评分5454 Mercury 2.5 评测数据:770 tokens 每秒输出、260k 上下文、智能指数 12
Artificial Analysis 页面显示,Inception 于 2026 年 9 月发布的 Mercury 2.5 是一个推理模型,输出速度达 770.4 tokens 每秒(同类价格档推理模型中位数为 108.6)。
HuggingFace Daily Papers(社区热门论文)AI 评分5050 IndicBankBench:评估印度零售银行语言模型助手的安全性与可靠性
研究推出 IndicBankBench,一个包含799个案例的印度零售银行基准测试,涵盖五个操作域及能力/拒绝域。该基准在安全、行动与工具使用、响应充分性及建议质量四个阶段进行评估,采用确定性检查结合LLM裁判。对11个模型的测试显示,严格通过率(pass^3)仅为43.7%至58.2%,远低于至少一次成功率的60%-74%,揭示了现有评估可能高估了银行场景下的可靠行为。数据集与评估框架已开源。
HuggingFace Daily Papers(社区热门论文)AI 评分4646 LLM 评测结论有多可复现?一项针对 LLM 推断提示词结构的自审计
一项自审计研究用 LLM 推断提示词结构作为案例,测试了 5 个模型家族、8B 至 675B 参数的 8 个开源模型变体,发现相同调用无法稳定还原相同结构,节点集 Jaccard 均值在 0.39 至 0.96 之间,72% 的提示词-模型组合从未达到节点集完全一致。
SemiAnalysis 长文 RSS(RSS)AI 评分5252 SemiAnalysis 发布 ClusterMAX 3.0 GPU 云服务商评级系统
SemiAnalysis 发布 ClusterMAX 3.0,对全球 GPU 云服务商进行迄今最深入的分析评级。评测覆盖可靠性、性能、支持、定价以及安全等维度,并以详尽细节展开。
The Verge:AI(RSS)AI 评分6161 Meta AI 智能体 Muse 评测:擅长花钱的可爱助手
The Verge 作者实测 Meta 的 AI 智能体 Muse,用它处理五项拖延已久的琐事,包括跟进园林报价、购买咖啡机零件、取消安保套餐和采购露营装备。多数任务能完成,但无法打电话改套餐,访问 Amazon 也被拦截;40 分钟内作者已交出姓名、地址、信用卡和安全账户凭据,且发现高效完成后反而腾出时间与机器人闲聊。
Artificial Analysis@ArtificialAnlys精选AI 评分7070推荐理由:原文给出智能指数与单任务成本的 Pareto 前沿新点位和具体分数价格,可用于横向比较各家模型性价比。
SemiAnalysis@SemiAnalysis_AI 评分5555
Arena.ai@arena精选AI 评分7575推荐理由:原文给出真实投票榜单的排名、价格和多分类变化,可以据此比较 GPT-6 Sol 在性能与成本上的位置。
Hacker News:AI 热帖AI 评分5353 DrivingBench 基准测试对比多个模型操控车辆沿赛道行驶的表现
drivingbench.com 页面对多个模型操控车辆沿赛道中心线行驶进行了对比,指标包括保持在 4 米内的进度占比、GPS 集成距离、完成时间、指令数以及 token 数与成本。
SemiAnalysis@SemiAnalysis_AI 评分5252
Artificial Analysis@ArtificialAnlysAI 评分6161METR:Blog(网页)精选AI 评分6262 METR 发布 Claude Opus 5.5 部署前评估摘要
METR 发布对 Claude Opus 5.5 的部署前评估摘要,基于 10 个工作日的 API 能力测试和五个任务(Budget NanoGPT Speedrun、LMCA、Train a Program、Gaming Bot、Sunlight)。
推荐理由:METR 作为第三方评估方给出了 Claude Opus 5.5 在 AI 研发加速上的量化结论,读者可据此了解部署前评估的证据基础与判断边界。
Artificial Analysis@ArtificialAnlysAI 评分7171
Arena.ai@arenaAI 评分6161
Artificial Analysis@ArtificialAnlysAI 评分5252
Artificial Analysis@ArtificialAnlysAI 评分5353Artificial Analysis 完整文章(网页)精选AI 评分7878 Artificial Analysis 评测 GPT-6 Sol 和 Luna:价格减半但各项表现有升有降
Artificial Analysis 评测 OpenAI 的 GPT-6 Sol 和 Luna,两模型价格较 GPT-5.6 约减半,Sol 定价 $2/$10、Luna $0.10/$0.50 每百万输入/输出 token。
推荐理由:Artificial Analysis 用自家指数实测两代模型的成本与表现,读者可据此判断 GPT-6 降价后哪些能力持平或退步。
Hacker News:AI 热帖AI 评分7474 Artificial Analysis 发布 Claude Opus 5.5 智能与价格分析(Max Effort)
Artificial Analysis 评测页面显示 Claude Opus 5.5(Adaptive Reasoning, Max Effort, Default Fallback)在 Artificial Analysis Intelligence Index 得 58 分,远高于同类中位数 25。
Artificial Analysis@ArtificialAnlysAI 评分8585
Arena.ai@arena精选AI 评分7272推荐理由:Arena 官宣 Claude Opus 5.5 上架 Agent Arena 和 Battle Mode,读者可以参与投票影响排行榜结果。
Artificial Analysis 完整文章(网页)精选AI 评分8282 Claude Opus 5.5 登顶 Artificial Analysis Intelligence Index
Artificial Analysis 实测 Claude Opus 5.5 在 Intelligence Index 得分 58,为其测得的最高分,并在 Terminal-Bench 4.0 上与 GPT-6 Astra 打平(59.6%)。
推荐理由:原文给出 Claude Opus 5.5 在 Intelligence Index 及各分项评测的完整数据和定价变化,读者可据此比较智能与任务成本。
OpenRouter:Announcements(RSS)精选AI 评分6262 OpenRouter 实测 Jev 1.13 与 Claude Opus 5 在 Banking77 分类任务上的准确率、延迟与成本
OpenRouter 用 Banking77 测试集的 3,080 条客服语料对比 Jev 1.13 与 Claude Opus 5 的意图分类表现。Jev 准确率 81.0% 比 Opus 的 84.4% 低 3.3 个百分点,但中位延迟 175 ms 约为 Opus(2,266 ms)的 1/13,每千次请求成本 $0.11 对 $2.42(启用提示词缓存)。
推荐理由:原文用同一测试流程给出两家模型的准确率、延迟与成本数据,并演示了基于置信度的级联路由方法,便于读者按自身流量权衡选型。
Artificial Analysis@ArtificialAnlysAI 评分7979Artificial Analysis 评测显示 Claude Opus 5.5 以 58 分登顶 Artificial Analysis Intelligence Index,为其实测最高分。
Hacker News:AI 热帖AI 评分6262 MiMo-V2.6-Pro 智能水平、性能与价格分析
Artificial Analysis 页面显示,小米的 MiMo-V2.6-Pro 在 Artificial Analysis Intelligence Index 得分 46,远高于同类开源权重模型中位数 18。
公众号:数字生命卡兹克精选AI 评分7272 卡兹克实测对比 Grok 4.7 与小米 MiMo V2.6:后者成不可能三角版本答案
作者实测同日凌晨发布的 Grok 4.7 与小米 MiMo V2.6,认为 Grok 4.7 低于预期,MiMo V2.6 成为性能、价格、速度三角的当前版本答案。
推荐理由:作者亲手测试并给出价格、速度和基准对比,读者可以据此评估小米 MiMo V2.6 对自身工作流和成本的实际影响。
Artificial Analysis@ArtificialAnlys精选AI 评分6565推荐理由:Artificial Analysis 实测 Step 5 Preview 的得分、成本与智能体短板,读者可据此对比同分段模型的表现与性价比。
Artificial Analysis 完整文章(网页)精选AI 评分6868 Artificial Analysis 评测 Grok 4.7:智能指数 46 分进入前四,编码智能体升至第 4
Artificial Analysis 发布 Grok 4.7 评测,Grok 4.7(xhigh)智能指数得 46 分,较 Grok 4.6 高 2 分,使 SpaceXAI 进入前四;搭配 Grok Build 的编码智能体指数从 47 升至 56,仅次于 Claude Fable 5.1、GPT-6 Astra 和 Claude Opus 5。
推荐理由:评测方给出 Grok 4.7 在多项基准的具体分数、token 消耗与对比对象,读者可据此判断其真实水平与成本。
Artificial Analysis@ArtificialAnlysAI 评分6666