跳到正文
原文
腾讯混元:Research(API)· RL Team·· 20 天前AI 评分44

当大模型强化学习走向规模化,Batch Size Scaling 有什么不一样?

当大模型强化学习走向规模化,Batch Size Scaling 有什么不一样?

AI 导读

腾讯混元研究团队从第一性原理分析 LLM 强化学习中的 batch size scaling,提出以 time-to-target 为判据:只有当吞吐增益 r_q 超过样本代价 r_N 时,更大的 batch 才能缩短训练时间。

整理与数据来源:AIHOT

来源:腾讯混元:Research(API) · hunyuan.tencent.com