Baseten Base Labs:模型研究·· 16 天前AI 评分52
Baseten Base Labs 实验研究蒸馏何时有助于强化学习
When does distillation help reinforcement learning?
AI 导读
Baseten Base Labs 用 Qwen3 0.6B/1.7B/4B/8B 在 16 个推理任务上比较 GRPO 直接训练与先用 gpt-5.6-sol 教师解法做 SFT 再 RL。
整理与数据来源:AIHOT
来源:Baseten Base Labs:模型研究 · labs.baseten.co