跳到正文
原文
HuggingFace Daily Papers(社区热门论文)·· 2026-09-02AI 评分45

Cliff:从第一个错误学习过程奖励的 RLVR 奖励塑形策略

Cliff: Learning Process Rewards from the First Mistake

AI 导读

论文提出 Cliff,一种奖励塑形策略,用现成 LLM 作为教师识别每次 rollout 中的第一个错误,将 rollout 分解为正确前缀和错误后缀,分别赋予正负 token 级优势。实验覆盖 12 个场景,Cliff 比.on-policy distillation 高 15%,比标准 GRPO 高 7%,即使教师能力一般也有效。

整理与数据来源:AIHOT

来源:HuggingFace Daily Papers(社区热门论文) · arxiv.org