Hugging Face:Blog(RSS)·· 2026-09-02AI 评分47
Hugging Face 与 Ai2 发布 BenchMIRT:从题目层面审计 LLM 基准究竟测了什么
BenchMIRT: What are LLM benchmarks actually measuring?
AI 导读
Hugging Face 博客介绍 BenchMIRT,一种基于多维 IRT 在单个题目层面审计 LLM 基准的方法,训练数据覆盖 100 个 LLM、16 个基准和超过 34K 道题。
整理与数据来源:AIHOT
来源:Hugging Face:Blog(RSS) · huggingface.co