DAIR.AI· @dair_ai · X·2026-09-08 05:00· 2026-09-08AI 评分53AI 导读Sierra 与普林斯顿大学发布 τ^τ-Bench(hyper-tau-bench)基准,把智能体构建本身设为任务:开发者智能体获得真实业务记录、掌握需求的客户、生产 API、待继承代码库和服务成本与模型限制,需交付一个可用的客服智能体,并用保留的模拟用户部署评分,共 4 个领域 53 个任务。另有 1 家信源报道整理与数据来源:AIHOT来源:DAIR.AI · x.com#Agent#编码#论文/研究