Ai2 / Allen Institute for AI(RSS)·· 2026-09-01AI 评分51
Ai2 发布 BenchMIRT:从题目层面审计 LLM 基准究竟在测什么
BenchMIRT: What are LLM benchmarks actually measuring?
AI 导读
Ai2 推出 BenchMIRT,一种基于多维 IRT 的方法,在单题层面审计 LLM 基准,训练数据覆盖 100 个模型的 16 个基准、超 34K 道题,并独立恢复出安全与通用推理两个维度。
整理与数据来源:AIHOT
来源:Ai2 / Allen Institute for AI(RSS) · allenai.org