Thomas Wolf· @Thom_Wolf · X·2026-09-17 21:42· 21 天前AI 评分55AI 导读小米团队称 MiMo-V2.6 目前正处于 RL 训练中途,探索 RL 的规模上限。其扩展了三个方向:算力(每步约 2B tokens,1568 prompts × 16 rollouts。整理与数据来源:AIHOT来源:Thomas Wolf · x.com#Agent#开源生态#数据/训练#行业动态