Reka AI 发布全模态模型 Rho-1,单模型处理文本图像视频与机器人控制
Reka AI 发布全模态模型 Rho-1 的研究预览版,这是一个 190 亿参数的模型,可在单一神经网络中处理并生成文本、图像、视频和机器人控制动作。与多数将任务分派给专用模型的系统不同,Rho-1 把所有模态作为 token 放在同一个共享上下文窗口中运行,无需工具调用或外部模型,可实时生成连续视频并即时响应新指令而无需重启。
Reka AI 发布全模态模型 Rho-1 的研究预览版,这是一个 190 亿参数的模型,可在单一神经网络中处理并生成文本、图像、视频和机器人控制动作。与多数将任务分派给专用模型的系统不同,Rho-1 把所有模态作为 token 放在同一个共享上下文窗口中运行,无需工具调用或外部模型,可实时生成连续视频并即时响应新指令而无需重启。
Black Forest Labs 发布 7B 开源权重世界动作模型 FLUX 3 Action,用于机器人控制,在 RoboLab-120 上以 42.92% 任务成功率排名第一,领先 Cosmos 3 Nano 6.1 个百分点且参数少 56%。
Black Forest Labs 发布 FLUX 3 Action,一个 7B 参数、开放权重的世界动作模型。官方称可将 FLUX 的视觉智能转化为动作能力,用于机器人、模拟器或游戏。
Black Forest Labs 发布面向机器人的开源模型 FLUX 3 Action,基于以视频数据训练的多模态 FLUX 3,可从机器人工作区的多机位视频预测智能体下一步动作及环境变化。BFL 称其仅 70 亿参数即在 RoboLab-120 排行榜创下成功率纪录,体积不到此前最佳开源模型一半,运行最快快至 3.95 倍;模型权重已上架 Hugging Face。
Figure 发布 Helix 2.5 模型,让人形机器人进入从未见过的家庭后立即自主完成整理客厅、折叠毛巾和整理床铺。Figure 在全球人类行为数据集 Index 上预训练该模型,并在湾区 30 户未收集过数据的家庭中实测;Index 预训练使任务成功率从 8% 提升到 56%,相比前代 Helix 02 只用一半任务专用数据即泛化到 30 个新环境。
蚂蚁灵波科技继 7 月开源 14B 模型后,本周开源 LingBot-World 2.0 Small(1.3B)、Bidirectional 和 Causal Pretrain 三款模型。
生数科技发布面向机器人灵巧操作的世界模型 Motus2,将行动、预测、评估三种能力统一进同一个共享参数模型,形成生成动作、预测未来、评估结果、更新策略的闭环,并加入轻量触觉专家模块。
Skild AI 发布 S1 机器人基础模型,通过 in-context learning 从单段视频演示理解并执行未见过的新任务,无需更新权重或任务专属后训练。
智元发布AGILE2.0感控一体模型,实现视觉感知、环境理解、全身运动控制与上下肢协同操作的端到端闭环耦合。通过短片《杂技BOT》展示灵犀X2钻火圈、跳长绳、踩球走、协作搬箱子等视觉驱动动态任务,其中踩球走为双足人形机器人自主实现。模型面向动态扰动、人机共存、多机协同等复杂场景,降低现实环境中的定制化开发代价,支持部署态规模化落地。
宇树全面开源 UnifoLM-WLA-1.0 具身基础模型,官方称在全球开源模型中于多个基准取得新 SOTA 结果。单一模型可协调桌面与全身移动操作,支持跨任务和跨末端执行器泛化,实现单模型全身协调。
宇树科技宣布完全开源新一代通用人形机器人基座模型 UnifoLM-WLA-1.0,称刷新全球开源模型多项评测 SOTA。真机评测中单模型统筹 64 个任务,覆盖桌面操作与全身移动操作,具备跨任务、跨末端执行器的泛化能力,在多项具身推理评测中领先国内外开源模型。
智元发布原生世界—动作模型GE-Act 2.0,所有参数从随机初始化在具身操作数据上从头训练,不针对评测任务微调或示范。
宇树科技宣布 UnifoLM-X2-1.0 实现世界模型实时驱动全自主人形机器人格斗,并公布实拍画面。官方称该模型突破瞬时规划、决策和动态交互执行等瓶颈,实现高动态、强交互的实时未来预测与规划,不再依赖预设程序或人工遥控。此前宇树人形机器人已在 2025 年进博会等场合多次公开格斗表演。
阿里千问本周开源 Qwen-Drive-1.0-4B,一款基于 Qwen3.5-4B 构建的自动驾驶视觉语言基础模型,官方称其为首个面向自动驾驶的视觉语言基础模型。
Qwen 团队发布 Qwen-Drive-1.0,称其为首个在预训练阶段统一 3D 感知与视觉问答、并延伸到运动规划的自动驾驶视觉语言基础模型,基于原生多模态 Qwen3.5-4B 且不改动预训练架构。
World Labs(李飞飞联合创立)发布世界模型 Atlas,可从几张照片完成 3D 场景生成、重建与仿真,输出最高 1440p、1 分钟的可控镜头视频,并支持点云与 3D Gaussian splats 等 3D 数据输出。
World Labs 发布新一代世界模型 Atlas,从零预训练,原生处理文本、图像、视频和 3D,架构为多模态自回归扩散 Transformer,输入以 3D 姿态形成空间上下文。模型支持相机控制生成(最长 1 分钟 1440p 视频)、稀疏视图 3D 重建、时空仿真和图像生成,在相机控制生成与 3D 重建任务上优于更专用的模型;现已开放早期访问申请,未来将驱动 Marble 等产品。
Google DeepMind 发布 Gemini Robotics ER 2,定位为机器人的高层大脑,可理解物理世界、规划多步任务,并把动作执行交给底层 VLA 模型,同时支持调用 Google Search 等工具。
推荐理由:官方给出 ER 2 相对 ER 1.6 的能力升级与开放入口,读者可据此判断机器人在视频理解与多机协作上的进展。
Google DeepMind 发布 Gemini Robotics 2,由 Gemini Robotics 2、Gemini Robotics ER 2 和 Gemini Robotics On-Device 2 三款模型组成,首次实现对人形机器人从脚到指尖的全身控制,并支持双手与夹爪的精细操作和多机器人协作。
推荐理由:官方给出三款模型的定位与开放入口,可据此判断机器人全身控制与端侧适配的进展。
Google DeepMind 发布 Gemini Robotics-ER 1.6,这是其面向机器人推理的模型升级版,重点增强空间推理与多视角理解,并新增仪表读数能力,可读取圆形压力表、液位指示器和数字读数。
推荐理由:官方给出与上一代及 Gemini 3.0 Flash 的对比,并首次开放仪表读数能力,可据此判断机器人在巡检场景的落地边界。