跳到正文
原文
HuggingFace Daily Papers(社区热门论文)·· 2026-09-01AI 评分46

HarnessDev:评测 LLM 能否自主创建并迭代自己的 Agent Harness 基准

HarnessDev: Can LLMs Create and Evolve Their Own Agent Harness?

AI 导读

论文提出 HarnessDev 基准,将评测单位从任务输出转向可运行的执行基础设施,涵盖 Creation(从最小种子构建完整执行系统)和 Evolution(基于下游执行反馈迭代改进)两个阶段,覆盖 6 个创建模型、4 个领域和 5 个下游基准共 2,207 个独立实例。

整理与数据来源:AIHOT

来源:HuggingFace Daily Papers(社区热门论文) · arxiv.org