DAIR.AI· @dair_ai · X·2026-09-14 23:20· 24 天前AI 评分62AI 导读Amazon 发布 GAUGE 论文,研究 LLM 模拟用户加 LLM judge 这一评估关卡何时不可信。研究发现满意度不等于任务成功,57.5% 被评为满意的对话实际未完成客户任务;在能力相近的智能体之间,该关卡有 31% 的配对选出奖励更低的一方,而差距大的配对中这一比例不足 1%。整理与数据来源:AIHOT来源:DAIR.AI · x.com#Agent#论文/研究