跳到正文

#评测/基准

今日 0 条
10月7日周三
  1. Simon Willison20

    Mistral Large 4 发布

    Mistral 发布 Mistral Large 4,模型可通过 llm 命令行工具以 mistral/mistral-large-4 调用。Simon Willison 用同一提示词让 Mistral Large 4 与 Claude Opus 5.5、GPT-6.1-sol、Gemini 3.8 Flash 分别生成 SVG 进行对比。

10月6日周二
  1. Simon Willison20

    Simon Willison 测试 Claude Opus 5.5 作曲能力:结果出人意料地好

    Simon Willison 让 Claude Opus 5.5 为电脑游戏作曲,要求先设计简单的文本音乐格式,再构建可播放的 artifact 并附示例曲目,风格对标《猴岛小英雄》。结果模型比预期更贴近猴岛主题,成品质量出人意料地好。他猜测这种作曲能力可能类似文本模型的 3D 图形能力,是近几个月才涌现的新能力,但需用更多新旧模型做实验才能确认。

10月4日周日
10月3日周六
9月29日周二
  1. Thomas Wolf55

    @classiclarryd 通报 Deven Pzak 将 NanoGPT 训练纪录从 67.6 秒压缩至 39.9 秒,PR 为 KellerJordan/modded-nanogpt#360。核心思路是在单个 flop 层面按价值取舍而非只优化 matmul,包括采样 softmax(约 8 秒)、ngram 嵌入的稀疏更新与优化器状态、分片稀疏通信、手写 64 维 head 的 flash attention、最后 300 步 EMA 与新优化器 Anvil2(约 1 秒)等。稀疏嵌入参数扩到 65B,贡献该 PR 约 25% 的收益;Thomas Wolf 转发并称 impressive,附上与 Deven 访谈整理的技术复盘 https://hyperstition.cc/training-nanogpt-in-39-9-seconds。

  2. Arena.ai69

    Arena 宣布 Anthropic 的 Claude Sonnet 5.5 已进入 Agent Arena,并开放投票。Agent Arena 基于全球用户数百万个真实的长程智能体任务评测模型,模型可使用 web search、filesystem 和 terminal 工具完成复杂工作流,榜单用因果追踪方法衡量模型相对平均模型的结果表现。

    推荐理由:Arena 介绍了其 Agent Arena 的评测方式,读者可以据此理解 Claude Sonnet 5.5 在真实智能体任务上的衡量口径。

9月28日周一
8月12日周三