跳到正文
原文
Tencent Hy· @TencentHunyuan · X·· 15 天前AI 评分40
AI 导读

腾讯混元研究将经典临界批大小理论扩展到在线 LLM 强化学习,发现在 GRPO 和 PPO 中,重新调整学习率可在有界批大小范围内保持每条响应的学习效果。在固定硬件上,扩大批大小使 PPO 生成阶段吞吐量最高提升 2.29×,最佳 GRPO 配置以少 29% 的时间达到相同验证目标。

整理与数据来源:AIHOT

来源:Tencent Hy · x.com