跳到正文
原文
Thomas Wolf· @Thom_Wolf · X·· 21 天前AI 评分55
AI 导读

小米团队称 MiMo-V2.6 目前正处于 RL 训练中途,探索 RL 的规模上限。其扩展了三个方向:算力(每步约 2B tokens,1568 prompts × 16 rollouts。

整理与数据来源:AIHOT

来源:Thomas Wolf · x.com