跳到正文

#评测/基准

今日 1 条
9月4日周五
9月3日周四
  1. Artificial Analysis70

    Artificial Analysis 评测显示,阿里巴巴 Wan 3.0 在视频编辑带音频榜单首次登顶第一,文生视频带音频位列第二,图生视频带音频排名第五。该模型为一体化视频生成与编辑模型,支持最长 30 秒 1080p 原生音频输出,可接受文本、图片、视频、音频、文档和网页作为创作参考,并支持指令式编辑画面、剧情、对话和声音。

  2. Epoch AI:研究、数据与评测69

    Epoch AI 评测 SWE-bench Verified:审计发现超两成题目存在评分问题

    Epoch AI 发布对 SWE-bench Verified 的基准评审,认定其为 Flawed。该基准用 500 道来自 12 个代码库的修复任务评测大语言模型;OpenAI 审计 27.6% 的任务后发现有缺陷测试的任务下限为 16.4%,59.4% 的被审任务测试用例会拒绝功能正确的提交,且所有受测前沿模型在训练中都见过部分题目。

    推荐理由:Epoch 汇总了 OpenAI 与 RDI 的公开审计结论,说明 SWE-bench Verified 的测试缺陷和污染问题,读者可据此调整对该基准的解读。

9月2日周三
  1. IT之家(RSS)35

    OPPO 联合多所高校推出端侧 AI 记忆评测基准 MobileMem

    OPPO 联合 OpenKG 及浙江大学、同济大学、东南大学等高校团队推出端侧 AI 记忆评测基准 MobileMem,技术白皮书已公开,数据集和相关工具将陆续开源。OPPO 首席产品官刘作虎称,端侧 AI 记忆是 AI 手机从一问一答走向主动服务智能体的基础能力,此前行业缺少统一评价标准;ColorOS 17 发布暨开发者大会将于 2026 年 9 月 17 日在珠海举行。

9月1日周二