跳到正文
原文
HuggingFace Daily Papers(社区热门论文)·· 2026-09-03AI 评分51

大模型 On-Policy Distillation 再思考 II:一条训练样本就够了

Rethinking On-Policy Distillation of Large Language Models II: One Training Example

AI 导读

研究探讨 on-policy distillation(OPD)中训练数据的作用,发现仅用 1 条 query 训练即可持续提升数百步并恢复全量数据 OPD 的大部分增益。

整理与数据来源:AIHOT

来源:HuggingFace Daily Papers(社区热门论文) · arxiv.org