跳到正文

#评测/基准

今日 1 条
今天10月8日周四
10月7日周三
  1. Simon Willison20

    Mistral Large 4 发布

    Mistral 发布 Mistral Large 4,模型可通过 llm 命令行工具以 mistral/mistral-large-4 调用。Simon Willison 用同一提示词让 Mistral Large 4 与 Claude Opus 5.5、GPT-6.1-sol、Gemini 3.8 Flash 分别生成 SVG 进行对比。

  2. Microsoft Research22

    微软研究员 Jennifer Neville:AI 评测的意外失败能教会我们什么

    微软研究院合伙人研究经理 Jennifer Neville 在 Microsoft Research Podcast 中与首席应用科学家 Chad Atalla 对谈,讨论评测如何推动 AI 系统性能边界、以及模型在传统 benchmark 之外测试时出现的「意外失败」。她分享了使用当前 AI 系统的实用建议,并强调当结果与预期不符时应仔细审视数据。

10月6日周二
  1. Simon Willison20

    Simon Willison 测试 Claude Opus 5.5 作曲能力:结果出人意料地好

    Simon Willison 让 Claude Opus 5.5 为电脑游戏作曲,要求先设计简单的文本音乐格式,再构建可播放的 artifact 并附示例曲目,风格对标《猴岛小英雄》。结果模型比预期更贴近猴岛主题,成品质量出人意料地好。他猜测这种作曲能力可能类似文本模型的 3D 图形能力,是近几个月才涌现的新能力,但需用更多新旧模型做实验才能确认。

  2. GitHub Blog · AI & ML60

    GitHub 发布 ReviewBench:面向 AI 代码审查的开放基准

    GitHub 发布 ReviewBench,一个面向 AI 代码审查智能体的开放离线基准,基于 1.039 亿个 GitHub PR 的分布特征构建,包含来自 187 个开源仓库、覆盖 19 种语言的 219 个 PR。

    推荐理由:GitHub 公开了代码审查基准的构建方法与评分口径,读者可据此理解 AI 代码审查评测如何贴近真实 PR 分布。

10月4日周日
10月3日周六
  1. The Verge · AI58

    OpenAI Dots 上手实测:企业级智能体也能帮你订晚餐

    OpenAI 本周发布智能体平台 Dots,作者以每月 100 美元的 Pro 账号实测,发现它更像能操作其他软件的工作软件,而非个人购物助手。Dots 可访问 Blender、GIMP 等应用,也能通过桌面版 ChatGPT 接入用户电脑,但在预约网络安装、登录宜家账户和订餐时多次卡在安全验证,需要人工接管。

10月2日周五
9月29日周二
  1. HuggingFace Daily Papers(社区热门论文)53

    GPT-6 Astra 跨计算机视觉评测揭示通用模型的能力边界

    该论文在 9 个领域、34 项能力和 55 个基准上评测 GPT-6 Astra 及五个前沿通用 AI 系统,并与专用模型和人类参考水平比较。Astra 在视觉与空间推理及多种结构化预测上显著领先其他系统;语义解释、推理和以物体为中心的预测接近或达到参考水平,但在度量几何精度、忠实重建、时序一致的密集预测和细粒度专业知识上仍有较大差距,附加推理与专用工具只能弥合部分缺口。

  2. Thomas Wolf55

    @classiclarryd 通报 Deven Pzak 将 NanoGPT 训练纪录从 67.6 秒压缩至 39.9 秒,PR 为 KellerJordan/modded-nanogpt#360。核心思路是在单个 flop 层面按价值取舍而非只优化 matmul,包括采样 softmax(约 8 秒)、ngram 嵌入的稀疏更新与优化器状态、分片稀疏通信、手写 64 维 head 的 flash attention、最后 300 步 EMA 与新优化器 Anvil2(约 1 秒)等。稀疏嵌入参数扩到 65B,贡献该 PR 约 25% 的收益;Thomas Wolf 转发并称 impressive,附上与 Deven 访谈整理的技术复盘 https://hyperstition.cc/training-nanogpt-in-39-9-seconds。

  3. Hacker News:AI 热帖49

    MicroLLM Lab:在浏览器中试用 7 款微型 LLM

    MicroLLM Lab 上线,可在浏览器内直接试用 7 款微型 LLM,并支持用 JavaScript 编写基准测试。测试以正则或精确 token 做客观校验,不评判写作质量,135M 模型允许失败,这本身就是测量结果。运行会记录 tokens/s 持续解码速度与客观测试通过率,数据只留在本机,图表按每个模型的最新测试套件展示。

  4. Arena.ai69

    Arena 宣布 Anthropic 的 Claude Sonnet 5.5 已进入 Agent Arena,并开放投票。Agent Arena 基于全球用户数百万个真实的长程智能体任务评测模型,模型可使用 web search、filesystem 和 terminal 工具完成复杂工作流,榜单用因果追踪方法衡量模型相对平均模型的结果表现。

    推荐理由:Arena 介绍了其 Agent Arena 的评测方式,读者可以据此理解 Claude Sonnet 5.5 在真实智能体任务上的衡量口径。

9月28日周一
  1. Berkeley RDI:Blog(AI 安全与评测)75

    UC Berkeley 团队用 AI Agent 审计 13 个基准,发现 45 个无需解题的满分作弊方案

    UC Berkeley 团队构建全自动 AI Agent 审计 13 个广泛使用的基准,发现 45 个作弊方案,全部基准被评为 critical 风险,共归纳 16 种攻击类型。

    推荐理由:原文给出了13个常用基准的45个作弊方案细节和防范设计原则,读者可以据此检查自己依赖的评测是否可信。

9月27日周日
9月26日周六