跳到正文
原文
Baseten Base Labs:模型研究·· 16 天前AI 评分52

Baseten Base Labs 实验研究蒸馏何时有助于强化学习

When does distillation help reinforcement learning?

AI 导读

Baseten Base Labs 用 Qwen3 0.6B/1.7B/4B/8B 在 16 个推理任务上比较 GRPO 直接训练与先用 gpt-5.6-sol 教师解法做 SFT 再 RL。

整理与数据来源:AIHOT

来源:Baseten Base Labs:模型研究 · labs.baseten.co