跳到正文
原文
HuggingFace Daily Papers(社区热门论文)·· 2026-09-03AI 评分42

DRACO:用动态评分标准做长程智能体训练的细粒度信用分配

DRACO: Fine-Grained Credit Assignment with Dynamic Rubrics for Long-Horizon Agent Training

AI 导读

DRACO 提出在结果信号缺失的长程智能体训练中,动态生成评分标准并按轨迹打分,再把判断以闭式方法重分配到相关步骤,在 GRPO 中产生差异化逐步优势,不引入任何训练的归因模块。

整理与数据来源:AIHOT

来源:HuggingFace Daily Papers(社区热门论文) · arxiv.org