elvis· @omarsar0 · X·2026-09-25 21:35· 13 天前AI 评分48AI 导读微软等机构提出 Taste-Bench,衡量前沿智能体在长任务决策点能否选对方向,最佳模型正确率仅 59.7%。该基准从工程与研究运行中的并行尝试和绕路自动挖掘分叉点,越依赖轨迹后段证据的分叉越难,加大推理预算也无法提升准确率。作者将教师模型对结果的判断蒸馏进学生模型,在留出的 SWE-bench Pro 任务上提升了端到端成功率。另有 1 家信源报道整理与数据来源:AIHOT来源:elvis · x.com查看事件全部后续