InfiniHand:从第一视角视频流式估计世界坐标系手部运动
InfiniHand 是一个端到端流式前馈框架,可直接从未标定的第一视角视频中联合估计 MANO 参数、相机轨迹和手部位置,无需级联独立的手部姿态估计器与 SLAM 系统。在域内基准上,其 ARCTIC PA-p 相比 ViDiHand 降低 21.4%,并显著缓解世界坐标系漂移,运行速度达 11.19 FPS,吞吐量超过 HaWoR 两倍。
InfiniHand 是一个端到端流式前馈框架,可直接从未标定的第一视角视频中联合估计 MANO 参数、相机轨迹和手部位置,无需级联独立的手部姿态估计器与 SLAM 系统。在域内基准上,其 ARCTIC PA-p 相比 ViDiHand 降低 21.4%,并显著缓解世界坐标系漂移,运行速度达 11.19 FPS,吞吐量超过 HaWoR 两倍。
苏黎世联邦理工学院软体机器人实验室基于常规仿人机械手,用强化学习训练出可依靠指尖自行行走的机械手,整机重 818 克,搭载树莓派机载计算机可独立运行。该机械手在 NVIDIA Isaac Lab 仿真平台完成训练,已在沥青、草地、碎石等 14 种表面爬行,25 次被碰倒中 21 次能自主站起;手指仍可恢复普通操作,敲键盘正确率达 90%,并通关推箱子游戏、定位精度达毫米级。
EditWorld 是一个支持精准编辑与灵活引用的视频世界模型,可在自回归生成过程中流式接收编辑指令和参考图像,将世界建模从探索扩展到精准修改。它引入 Gated Causal Attention 处理时变编辑条件与参考图像,并用 Sparse Context 机制维持有界历史上下文以支持长时程推理。
研究者提出 Physical Coding,将任务状态与执行表示为代码,并构建 HexaAnything 调用感知、规划与控制工具(含 VLA/WAM 策略),依据外部反馈在环决策。
研究提出 Recursive Harness Distillation,让强智能体把干预经验蒸馏成 playbook 供轻量智能体使用,并借助轻量智能体的执行反馈递归优化,无需更新模型参数。
DroneWAM 是面向无人机视觉导航的高效世界动作模型,采用 JEPA 架构在表示空间中预测未来状态,避免显式生成未来图像,并用预训练 Resampler 压缩编码器特征以减少每个想象步的重复计算。在仿真数据集 DroneNav-6D 上,DroneWAM 取得对比方法中最佳轨迹精度,自适应 rollout 将平均预测深度从 8 降至 4.58,同时提升轨迹精度。
REALM(Reactive Embodied Audio-driven Listening Model)是一个由粗到细的音频驱动反应式聆听框架,通过 Reactive Gated Speaker-Listener Fusion 模块结合聆听者动作历史与说话人音频,并用粗解码器预测基础动作轨迹、在表情子空间叠加音频条件随机残差。
RoboFoundry 提出“自演化系统即策略”的具身智能体框架,将执行轨迹转化为经验证的任务级系统更新,并沉淀为通用系统能力。在 EmbodiedBench 上,它把 GPT-5.5 提升 27.8%,并让 Qwen3.7-Plus 达到 70.3%、接近 GPT-5.5 的 72.7%。
论文介绍 PUBG Ally,一个在 PUBG: BATTLEGROUNDS 中作为语音队友的具身智能体,可感知动态游戏环境并自主行动。语言模型智能体通过受控接口检查游戏信息、理解玩家语音并下发高层动作,交给更快的控制层执行移动、战斗和恢复;团队基于近 39k 场真实玩家共玩对局的数据做迭代训练,并通过模型压缩、上下文压缩、安全训练和运行时护栏实现低延迟端侧部署与玩家沟通安全。
上海AI实验室推出 InternW 物理世界模型系列的首个模型 InternW0,通过非对称视频动作架构结合 flow matching 联合学习未来视觉动态与连续机器人控制,视频专家提供长时程预测上下文,轻量动作专家以更快频率运行,并通过复用层间 K/V 和观察条件上下文路由避免每次动作更新都重新生成未来。
Rolling-WAM 将视频-动作联合去噪分散到连续的重规划周期中,通过滑动窗口在不同噪声水平上维护视频-动作块,每步完整去噪即将执行的动作块、部分精炼更远的未来块。在 LIBERO、RoboTwin 和真实 Unitree G1 人形机器人上,该方法取得有竞争力的操作性能,相比标准联合 WAM 实现 4.5 倍稳态重规划加速。
微软研究院发布关于物理AI机器人推理基础设施的研究。通过系统评估移动操作任务,发现将推理从机载GPU卸载至边缘或云端,能解决机载算力限制模型规模、导致响应延迟(最高383%)及精度下降的问题。实验显示,卸载推理不仅提升了任务成功率,还通过替换高功耗机载GPU为轻量硬件(如树莓派),使机器人电池寿命延长高达160%。此外,微软推出了基于Kubernetes的Physical AI Toolchain工具集,支持自动化容器化与分布式推理部署。
研究者提出 EmbodiedMemory-Bench(EMem-Bench),包含 4 类任务家族共 2,554 个交互 episode,要求智能体从交互历史中构建并更新记忆,再据此在环境中完成后续任务。
D-JEPA 是一种决策对齐的潜在世界模型,通过学习已执行结果中候选未来之间的决策相关关系,弥补预测精度与决策质量之间的"决策局部预测差距"。它在 PushT 上达到 87.89% 成功率,在 RoboTwin 上平均提升 15.04 分,在物理机器人任务上提升 17 分。该方法兼容 JEPA 未来表征,可通过原生潜在距离规划部署。
IDC 发布《全球四足机器人市场份额,1H26》报告,2026 上半年全球四足机器人出货量超 4.9 万台,同比增长 92.5%,市场规模超 4 亿美元。教育科研和家用消费贡献约 60% 出货量但收入不足三分之一;行业级应用市场规模超 2.7 亿美元,同比增长 125.1%,部署量同比增长 260.5%,云深处科技位居行业级应用市场首位。
该研究提出 Tactile-JEPA,一种针对分布式电子皮肤(e-skin)的自监督预训练方法。它利用传感器连接图指导空间掩码,通过预测被掩码传感单元的嵌入来学习拓扑感知表示。在三个数据集上的实验显示,相比先前 SOTA,该方法将力估计误差降低 6.3%,手内方向误差降低 20.8%。代码已开源。
Robocurve 团队发布 RoboHarm 安全基准,让 GPT-6 Astra、Claude Fable 5.1 和 MolmoAct2 分别控制一对 I2RT-YAM 机械臂,每条危险指令测试 20 次,共 300 次试验由人工审看视频评估。
针对预训练视觉-语言-动作(VLA)模型在精确任务中不可靠及在线强化学习存在的价值信号不稳定与大模型开销瓶颈,提出 VLA-Precision 框架。该框架包含 ACoB 算法与 ACoB-Stream 架构,通过跨时间尺度的非对称协同自举抑制策略漂移,并实现状态解耦与按需流式处理以提升效率。在九项高精度化学任务评估中,该方法达到 98.3% 平均成功率,吞吐量提升高达 10.9 倍。
机器人基准 StationeryBench 在 200 次试验中对比 GPT-6 Astra 与 Ai2 MolmoAct2 控制同样的双臂 YAM 机器人完成五类桌面物体任务,Astra 完整完成 100 项任务中的 7 项、中位进展分 46,MolmoAct2 均为 0 和 12。
Axis Robotics 与 UC Berkeley、Georgia Tech、NTU 等机构提出 AXIS,把机器人操作演示采集搬进浏览器,通过 MuJoCo WebAssembly 前端遥操作 Franka Research 3,发布含 207 个任务、50,129 条轨迹、超 6 万种任务或场景变体的数据集,由 7 万多名社区成员贡献。
据《日经亚洲》报道,大阪大学森岛圭祐团队开发昆虫协同回路,AI 分析蟑螂心跳、神经信号和身体运动来判断环境并引导避险,在紫外线、化学物质和高温等五种环境测试中最高识别准确率达 93%,成果已发表于《Robomech Journal》。
论文在 ParcelStow 接触密集任务中对比脚本专家与基于 ACT 训练的模仿策略在不同加速倍数下的表现,发现两者在名义速度下均为 100% 成功,但在最大演示速度下专家成功率为 84%,ACT 仅 53%,且两种不同参数初始化的 ACT 策略分别下降 34 和 48 个百分点,专家仅下降 16 个百分点。
Apple Machine Learning Research 发布 REFACTOR-VLA 研究,针对 OpenVLA、π0、RT-2、RDT-1B 等当前视觉-语言-动作(VLA)模型生成原始动作的“单体式”结构,提出以无监督方式学习类型化运动程序库的方法。
论文提出 DroneCATS-Agent 架构和 DroneCATS 基准,将多模态大模型直接放入无人机控制回路,无需微调或函数调用,评测接近、跟踪、视外搜索和多机指挥四项能力。结果显示小型开源模型导航成功率常高于前沿模型,却因过早或从不宣布到达而失败;模型的视觉空间感知尚可,瓶颈在于维持动作协议并正确发出终止动作。
H3-World 提出一个把 33B MiniMax-H3 视频生成器转化为交互式世界模型的框架,通过自然语言指令实现精确的时间对齐世界控制。
论文提出 RoboTok,一个互联网规模数据引擎,输入人类操作视频即可从网络视频中检索与操作相关的人类示范,用于训练灵巧机器人策略。方法基于估计的演员中心参考系中的 3D 手部轨迹学习潜在运动空间,使操作行为的比较不受相机视角、场景外观和演员遮挡影响,并支持互联网规模视频的高效搜索与持续索引。在检索基准和下游策略评估中,RoboTok 检索出更相关的示范并提升了下游任务成功率。
研究团队发布 LightNav-0,一个紧凑的通用具身导航模型,通过双通道指向和残差向量量化动作 tokenizer 激发预训练 VLM 的空间智能,无需任务专用预测头。训练语料覆盖 2K+ 场景和 4K+ 小时具身导航数据,LightNav-0 在全部 10 个公开导航仿真环境中取得单目成功率 SOTA,真实世界评测显示跨机器人本体、场景及静态动态目标的零样本泛化能力。
论文提出 MineAmongUs,一个 3D 多模态 Among Us 沙盒,让 imposter 智能体通过言语与非言语联合行动欺骗船员,并配套可配置的 VLM 智能体框架 ARIA 和基于欺骗分类学的原子与弧级标注方案。
论文提出 NavMCP,一个将 VLM 推理智能体与导航基础模型(NFM)执行器耦合的智能体脚手架框架,通过意图、观察、记忆三条通道协作,无需重训任一模型即可实现长时程探索。
Lucida 提出可组合真实到仿真场景建模方法,将真实室内场景恢复为按观测排布、可单独操作的完整可编辑物体资产。方法沿用解析、生成、放置三步,但把精度要求重新分配到流水线末端:解析视频生成携带逐实例多视角证据的场景图,据此生成完整资产,并用 VLM 策略 GizmoAct 将放置建模为多轮 GUI 交互,闭环操纵物体 gizmo 并自行判断对齐完成。