Rohan Paul· @rohanpaul_ai · X·2026-09-17 04:25· 22 天前AI 评分59AI 导读耶鲁大学联合多所机构论文审计 6 个主流物理基准后发现,模型被误判的失败大多源于糟糕题目、错误参考答案和脆弱的评分器。在 4 个被审计基准子集的 250 个被拒案例中,仅 12 个是模型真实错误;GPT-5.6-Sol 经专家复评后 HLE-Physics 分数从 47.3% 升至 78.7%。整理与数据来源:AIHOT来源:Rohan Paul · x.com#推理#论文/研究