跳到正文
原文
Ai2 / Allen Institute for AI(RSS)·· 2026-09-01AI 评分51

Ai2 发布 BenchMIRT:从题目层面审计 LLM 基准究竟在测什么

BenchMIRT: What are LLM benchmarks actually measuring?

AI 导读

Ai2 推出 BenchMIRT,一种基于多维 IRT 的方法,在单题层面审计 LLM 基准,训练数据覆盖 100 个模型的 16 个基准、超 34K 道题,并独立恢复出安全与通用推理两个维度。

整理与数据来源:AIHOT

来源:Ai2 / Allen Institute for AI(RSS) · allenai.org