跳到正文

#具身智能

今日 0 条
10月6日周二
  1. The Decoder65

    Reka AI 发布全模态模型 Rho-1,单模型处理文本图像视频与机器人控制

    Reka AI 发布全模态模型 Rho-1 的研究预览版,这是一个 190 亿参数的模型,可在单一神经网络中处理并生成文本、图像、视频和机器人控制动作。与多数将任务分派给专用模型的系统不同,Rho-1 把所有模态作为 token 放在同一个共享上下文窗口中运行,无需工具调用或外部模型,可实时生成连续视频并即时响应新指令而无需重启。

9月26日周六
9月25日周五
  1. The Decoder:AI News(RSS)56

    Black Forest Labs 发布开源机器人模型 FLUX 3 Action

    Black Forest Labs 发布面向机器人的开源模型 FLUX 3 Action,基于以视频数据训练的多模态 FLUX 3,可从机器人工作区的多机位视频预测智能体下一步动作及环境变化。BFL 称其仅 70 亿参数即在 RoboLab-120 排行榜创下成功率纪录,体积不到此前最佳开源模型一半,运行最快快至 3.95 倍;模型权重已上架 Hugging Face。

9月18日周五
  1. IT之家(RSS)63

    Figure 发布 Helix 2.5 模型,人形机器人可自主做家务

    Figure 发布 Helix 2.5 模型,让人形机器人进入从未见过的家庭后立即自主完成整理客厅、折叠毛巾和整理床铺。Figure 在全球人类行为数据集 Index 上预训练该模型,并在湾区 30 户未收集过数据的家庭中实测;Index 预训练使任务成功率从 8% 提升到 56%,相比前代 Helix 02 只用一半任务专用数据即泛化到 30 个新环境。

9月16日周三
  1. Rohan Paul54

    Odyssey 发布基础世界模型 Odyssey-3,称其可控制机器人、驱动人形、驾驶车辆、训练 AI、操控无人机甚至玩视频游戏。其路线是先用预训练世界模型,再接上用数十小时机器人演示训练的动作解码器;据作者转述,驾驶策略仅用 20 小时模拟数据训练后就能驶上印度真实街道,机械臂、人形遥操作和模拟无人机数据的用量也仅为数十小时。

9月13日周日
9月12日周六
9月11日周五
  1. AGIBOT 智元(网页)56

    智元发布AGILE2.0感控一体模型,灵犀X2完成踩球走等视觉驱动任务

    智元发布AGILE2.0感控一体模型,实现视觉感知、环境理解、全身运动控制与上下肢协同操作的端到端闭环耦合。通过短片《杂技BOT》展示灵犀X2钻火圈、跳长绳、踩球走、协作搬箱子等视觉驱动动态任务,其中踩球走为双足人形机器人自主实现。模型面向动态扰动、人机共存、多机协同等复杂场景,降低现实环境中的定制化开发代价,支持部署态规模化落地。

9月10日周四
  1. IT之家(RSS)55

    宇树科技完全开源通用人形机器人基座模型 UnifoLM-WLA-1.0,刷新开源多项评测 SOTA

    宇树科技宣布完全开源新一代通用人形机器人基座模型 UnifoLM-WLA-1.0,称刷新全球开源模型多项评测 SOTA。真机评测中单模型统筹 64 个任务,覆盖桌面操作与全身移动操作,具备跨任务、跨末端执行器的泛化能力,在多项具身推理评测中领先国内外开源模型。

9月9日周三
9月8日周二
9月7日周一
  1. IT之家(RSS)55

    宇树科技发布 UnifoLM-X2-1.0:世界模型实时驱动全自主人形机器人格斗

    宇树科技宣布 UnifoLM-X2-1.0 实现世界模型实时驱动全自主人形机器人格斗,并公布实拍画面。官方称该模型突破瞬时规划、决策和动态交互执行等瓶颈,实现高动态、强交互的实时未来预测与规划,不再依赖预设程序或人工遥控。此前宇树人形机器人已在 2025 年进博会等场合多次公开格斗表演。

9月6日周日
9月4日周五
9月3日周四
9月2日周三
  1. 凡人小北62

    World Labs 团队宣布达成重要里程碑,发布从头训练的多模态世界模型 Atlas,称其为首个此类模型。Atlas 支持像素级精确的相机控制生成帧、从单张输入图像重建大场景、通过重构视频模拟时空、从一张或多张图像原生输出 3D 空间,以及将多张带位姿图像合成为一致的 3D 世界,并称其为目前最好的相机条件世界模型,可用于 VFX 到机器人等场景。

  2. Hacker News 热门(buzzing.cc 中文翻译)70

    World Labs 发布世界模型 Atlas:面向空间智能的多模态自回归扩散 Transformer

    World Labs 发布新一代世界模型 Atlas,从零预训练,原生处理文本、图像、视频和 3D,架构为多模态自回归扩散 Transformer,输入以 3D 姿态形成空间上下文。模型支持相机控制生成(最长 1 分钟 1440p 视频)、稀疏视图 3D 重建、时空仿真和图像生成,在相机控制生成与 3D 重建任务上优于更专用的模型;现已开放早期访问申请,未来将驱动 Marble 等产品。

  3. Fei-Fei Li57

    World Labs 发布从零训练的多模态世界模型 Atlas。模型可生成具有像素级相机控制能力的图像和视频帧,从单张输入图像重建大型场景,通过重帧视频模拟时空,并从一张或多张输入图像原生输出 3D 空间,还能将多张带位姿的图像合成一致的三维世界。作者称其为迄今最好的相机条件世界模型,可能应用于 VFX 到机器人等多个方向。

7月30日周四
  1. Google DeepMind71

    Google DeepMind 发布 Gemini Robotics ER 2 具身推理模型

    Google DeepMind 发布 Gemini Robotics ER 2,定位为机器人的高层大脑,可理解物理世界、规划多步任务,并把动作执行交给底层 VLA 模型,同时支持调用 Google Search 等工具。

    推荐理由:官方给出 ER 2 相对 ER 1.6 的能力升级与开放入口,读者可据此判断机器人在视频理解与多机协作上的进展。

7月28日周二
  1. Google DeepMind74

    Google DeepMind 发布 Gemini Robotics 2,实现机器人全身控制

    Google DeepMind 发布 Gemini Robotics 2,由 Gemini Robotics 2、Gemini Robotics ER 2 和 Gemini Robotics On-Device 2 三款模型组成,首次实现对人形机器人从脚到指尖的全身控制,并支持双手与夹爪的精细操作和多机器人协作。

    推荐理由:官方给出三款模型的定位与开放入口,可据此判断机器人全身控制与端侧适配的进展。

4月13日周一
  1. Google DeepMind66

    Google DeepMind 发布 Gemini Robotics-ER 1.6,新增仪表读数能力

    Google DeepMind 发布 Gemini Robotics-ER 1.6,这是其面向机器人推理的模型升级版,重点增强空间推理与多视角理解,并新增仪表读数能力,可读取圆形压力表、液位指示器和数字读数。

    推荐理由:官方给出与上一代及 Gemini 3.0 Flash 的对比,并首次开放仪表读数能力,可据此判断机器人在巡检场景的落地边界。