Sierra:Blog(RSS)· Ben Shi, Keshav Dhandhania·· 2026-09-09AI 评分38
Sierra 开源 hyper-𝜏-bench:评估能构建智能体的智能体
Hyper-𝜏-bench: Evaluating agents that build agents
AI 导读
Sierra 今日开源 hyper-𝜏-bench,这是一个新的长时程智能体评测基准,用于衡量模型不仅能作为智能体行动、还能构建智能体的能力。该基准聚焦于“构建智能体的智能体”这一任务场景,为长时程自主智能体开发提供评测标准。
整理与数据来源:AIHOT
来源:Sierra:Blog(RSS) · sierra.ai