跳到正文
原文
HuggingFace Daily Papers(社区热门论文)·· 2026-08-31AI 评分40

AutoSciRub 提出评估优先框架,用自动归纳评分标准提升科研 Agent 表现

Learning to Evaluate Before Improving: Automatic Rubric Induction for Automatic Research Agents

AI 导读

论文提出 AutoSciRub,一个评估优先框架,在科研任务执行前自动归纳任务专属的可执行评分标准(rubric),用于指导执行、逐条验证和迭代修订。该框架将模糊指令分解为原子科学目标,结合文献和任务数据合成具体可验证的标准。

整理与数据来源:AIHOT

来源:HuggingFace Daily Papers(社区热门论文) · arxiv.org