跳到正文
原文
Sierra:Blog(RSS)· Ben Shi, Keshav Dhandhania·· 2026-09-09AI 评分38

Sierra 开源 hyper-𝜏-bench:评估能构建智能体的智能体

Hyper-𝜏-bench: Evaluating agents that build agents

AI 导读

Sierra 今日开源 hyper-𝜏-bench,这是一个新的长时程智能体评测基准,用于衡量模型不仅能作为智能体行动、还能构建智能体的能力。该基准聚焦于“构建智能体的智能体”这一任务场景,为长时程自主智能体开发提供评测标准。

整理与数据来源:AIHOT

来源:Sierra:Blog(RSS) · sierra.ai