Stanford HAI News(网页)·· 14 天前AI 评分58
Stanford 研究发现 AI 基准测试常常测不出它声称测量的东西
The Tests That Grade AI May Be Getting It Wrong
AI 导读
Stanford 研究者将在 10 月旧金山 COLM 会议上发表两项研究,用测量科学与心理测量学检验 56 个常用基准,发现基准并不总是测量其声称的能力,声称测同一属性的基准之间也常互相矛盾。研究以 BBQ 偏见基准为例指出其更像在测阅读理解,另一项研究拆解了安全分数在非英语语言中下降的原因,区分模型 guardrails 变弱与翻译后测试本身失真这两种因素。
整理与数据来源:AIHOT
来源:Stanford HAI News(网页) · hai.stanford.edu