Rohan Paul· @rohanpaul_ai · X·2026-09-04 07:56· 2026-09-04AI 评分42AI 导读Microsoft 与加州大学圣地亚哥分校的论文指出,模型在 SFT 后可能看起来更好,但因 SFT 会抹掉 RL 需要发现的罕见正确行为,反而是更差的 RL 起点。整理与数据来源:AIHOT来源:Rohan Paul · x.com#推理#数据/训练#论文/研究