HuggingFace Daily Papers(社区热门论文)·· 2026-08-31AI 评分49
研究分析 On-Policy Distillation 机制并提出无监督方法 OPSA
Does On-Policy Distillation Really Distill? From Noisy Teacher to Self-Improvement
AI 导读
论文定量分析 on-policy distillation(OPD)训练中的教师监督,发现其噪声随教师规模增大而增加,且学生策略对该噪声不敏感。学习集中在低 log-probability token 上,用单一固定负优势即可匹配教师提供的信号,表明 OPD 主要通过抑制低概率 token 起作用而无需教师。
整理与数据来源:AIHOT
来源:HuggingFace Daily Papers(社区热门论文) · arxiv.org