#评测/基准
#评测/基准
今日 1 条
DAIR.AI@dair_aiAI 评分4646Artificial Analysis 完整文章(网页)精选AI 评分7575 Artificial Analysis 实测 Claude Fable 5.1 登顶智能指数但每任务成本高 20%
Artificial Analysis 评测 Claude Fable 5.1,其以 66 分登顶 Artificial Analysis Intelligence Index,超过 Claude Opus 5(63)、Fable 5(62)、GPT-5.6 Sol(61)和 Grok 4.6(61)。
推荐理由:Artificial Analysis 实测了 Claude Fable 5.1 的智能指数、各基准得分与每任务成本,读者可据此权衡其相对 Opus 5 和 GPT-5.6 的性价比。
Microsoft ResearchAI 评分3838 微软发布 MindTopo 基准,揭示多模态模型拓扑推理短板
Microsoft Research 推出 MindTopo 基准,用于评估多模态大语言模型的拓扑推理能力,覆盖连通性、分离、顺序、包围与打结五类任务,并区分静态识别与交互规划两个认知层级。测试显示,当前专有与开源模型在静态推理上明显强于交互规划,且两者均远低于人类水平;失败多出现在规划阶段而非感知阶段,模型在场景变化后难以维持结构关系。图像与视频生成仅在单帧关系可见时偶有帮助,跨序列仍不可靠。
Microsoft ResearchAI 评分4040 Microsoft Research 推出 CARE-X:面向临床放射学的胸部 X 光 VLM
Microsoft Research 发布研究模型 CARE-X,一个面向胸部 X 光多种临床解读任务的统一视觉语言模型,结合生成式与结构化预测,并用强化学习(DAPO)在多任务设置下奖励临床正确性。
Google DeepMind精选AI 评分6262 WeatherNext 如何帮助美国国家飓风中心预测飓风 Melissa 登陆牙买加
Google DeepMind 与 Google Research 开发的 AI 天气模型 WeatherNext 帮助美国国家飓风中心提前五天预测飓风 Melissa 将以五级强度登陆牙买加,置信度 80%,三天前升至接近 100%。
推荐理由:原文给出 WeatherNext 在 2025 年飓风季的官方验证结果,读者可据此了解 AI 天气模型在路径与强度预测上的实际表现。