Fuli Luo· @_LuoFuli · X·· 16 天前AI 评分71
AI 导读
罗福莉介绍 MiMo-V2.6,称其可能是开源模型团队迄今按计算量计最大的单次 RL 运行,现为排名第一的开源模型。MixRL 用于中等难度可验证任务(如代码与相关 Agentic 任务),难以验证或超长程任务单独训练后经 MOPD 合并;团队同时发布了从 MiMo RL 轨迹蒸馏的 Qwen 模型、7K 多样化环境和完整 RL 训练框架。
整理与数据来源:AIHOT
来源:Fuli Luo · x.com