跳到正文
原文
Rohan Paul· @rohanpaul_ai · X·· 22 天前AI 评分59
AI 导读

耶鲁大学联合多所机构论文审计 6 个主流物理基准后发现,模型被误判的失败大多源于糟糕题目、错误参考答案和脆弱的评分器。在 4 个被审计基准子集的 250 个被拒案例中,仅 12 个是模型真实错误;GPT-5.6-Sol 经专家复评后 HLE-Physics 分数从 47.3% 升至 78.7%。

整理与数据来源:AIHOT

来源:Rohan Paul · x.com