HuggingFace Daily Papers(社区热门论文)·· 2026-09-03AI 评分51
大模型 On-Policy Distillation 再思考 II:一条训练样本就够了
Rethinking On-Policy Distillation of Large Language Models II: One Training Example
AI 导读
研究探讨 on-policy distillation(OPD)中训练数据的作用,发现仅用 1 条 query 训练即可持续提升数百步并恢复全量数据 OPD 的大部分增益。
整理与数据来源:AIHOT
来源:HuggingFace Daily Papers(社区热门论文) · arxiv.org