Rohan Paul· @rohanpaul_ai · X·· 2026-09-01AI 评分61
AI 导读
一篇论文在固定 12 个模型和 3,679 个问题的前提下,只改变提示词格式、选项顺序、打分方式等常规评测设置,结果排名大幅波动。gemma4-31b 得分在 31% 到 89% 之间,12 个模型中有 4 个至少在一种有效设置下排到第一;相邻模型平均 95.7% 的差距来自评测设置改变时会翻转答案的题目,最大不稳定来源是打分方式,即生成答案还是选最高似然选项。
整理与数据来源:AIHOT
来源:Rohan Paul · x.com