跳到正文

#评测/基准

今日 1 条
9月1日周二
  1. Artificial Analysis 完整文章(网页)75

    Artificial Analysis 实测 Claude Fable 5.1 登顶智能指数但每任务成本高 20%

    Artificial Analysis 评测 Claude Fable 5.1,其以 66 分登顶 Artificial Analysis Intelligence Index,超过 Claude Opus 5(63)、Fable 5(62)、GPT-5.6 Sol(61)和 Grok 4.6(61)。

    推荐理由:Artificial Analysis 实测了 Claude Fable 5.1 的智能指数、各基准得分与每任务成本,读者可据此权衡其相对 Opus 5 和 GPT-5.6 的性价比。

8月13日周四
  1. Microsoft Research38

    微软发布 MindTopo 基准,揭示多模态模型拓扑推理短板

    Microsoft Research 推出 MindTopo 基准,用于评估多模态大语言模型的拓扑推理能力,覆盖连通性、分离、顺序、包围与打结五类任务,并区分静态识别与交互规划两个认知层级。测试显示,当前专有与开源模型在静态推理上明显强于交互规划,且两者均远低于人类水平;失败多出现在规划阶段而非感知阶段,模型在场景变化后难以维持结构关系。图像与视频生成仅在单帧关系可见时偶有帮助,跨序列仍不可靠。

8月12日周三
5月16日周六
  1. Google DeepMind62

    WeatherNext 如何帮助美国国家飓风中心预测飓风 Melissa 登陆牙买加

    Google DeepMind 与 Google Research 开发的 AI 天气模型 WeatherNext 帮助美国国家飓风中心提前五天预测飓风 Melissa 将以五级强度登陆牙买加,置信度 80%,三天前升至接近 100%。

    推荐理由:原文给出 WeatherNext 在 2025 年飓风季的官方验证结果,读者可据此了解 AI 天气模型在路径与强度预测上的实际表现。