跳到正文

#具身智能

今日 0 条
9月29日周二
  1. HuggingFace Daily Papers(社区热门论文)43

    InfiniHand:从第一视角视频流式估计世界坐标系手部运动

    InfiniHand 是一个端到端流式前馈框架,可直接从未标定的第一视角视频中联合估计 MANO 参数、相机轨迹和手部位置,无需级联独立的手部姿态估计器与 SLAM 系统。在域内基准上,其 ARCTIC PA-p 相比 ViDiHand 降低 21.4%,并显著缓解世界坐标系漂移,运行速度达 11.19 FPS,吞吐量超过 HaWoR 两倍。

  2. IT之家(RSS)54

    ETH Zurich 研发出能用指尖自行行走的五指机械手

    苏黎世联邦理工学院软体机器人实验室基于常规仿人机械手,用强化学习训练出可依靠指尖自行行走的机械手,整机重 818 克,搭载树莓派机载计算机可独立运行。该机械手在 NVIDIA Isaac Lab 仿真平台完成训练,已在沥青、草地、碎石等 14 种表面爬行,25 次被碰倒中 21 次能自主站起;手指仍可恢复普通操作,敲键盘正确率达 90%,并通关推箱子游戏、定位精度达毫米级。

  3. HuggingFace Daily Papers(社区热门论文)42

    EditWorld:面向可交互世界的精准编辑与灵活引用视频世界模型

    EditWorld 是一个支持精准编辑与灵活引用的视频世界模型,可在自回归生成过程中流式接收编辑指令和参考图像,将世界建模从探索扩展到精准修改。它引入 Gated Causal Attention 处理时变编辑条件与参考图像,并用 Sparse Context 机制维持有界历史上下文以支持长时程推理。

9月27日周日
  1. HuggingFace Daily Papers(社区热门论文)32

    DroneWAM:面向无人机视觉导航的高效世界动作模型

    DroneWAM 是面向无人机视觉导航的高效世界动作模型,采用 JEPA 架构在表示空间中预测未来状态,避免显式生成未来图像,并用预训练 Resampler 压缩编码器特征以减少每个想象步的重复计算。在仿真数据集 DroneNav-6D 上,DroneWAM 取得对比方法中最佳轨迹精度,自适应 rollout 将平均预测深度从 8 降至 4.58,同时提升轨迹精度。

9月26日周六
9月25日周五
  1. HuggingFace Daily Papers(社区热门论文)51

    PUBG Ally:PUBG 中可语音对话的具身智能体队友

    论文介绍 PUBG Ally,一个在 PUBG: BATTLEGROUNDS 中作为语音队友的具身智能体,可感知动态游戏环境并自主行动。语言模型智能体通过受控接口检查游戏信息、理解玩家语音并下发高层动作,交给更快的控制层执行移动、战斗和恢复;团队基于近 39k 场真实玩家共玩对局的数据做迭代训练,并通过模型压缩、上下文压缩、安全训练和运行时护栏实现低延迟端侧部署与玩家沟通安全。

9月24日周四
  1. HuggingFace Daily Papers(社区热门论文)57

    上海AI实验室发布 InternW0 物理世界模型基础版

    上海AI实验室推出 InternW 物理世界模型系列的首个模型 InternW0,通过非对称视频动作架构结合 flow matching 联合学习未来视觉动态与连续机器人控制,视频专家提供长时程预测上下文,轻量动作专家以更快频率运行,并通过复用层间 K/V 和观察条件上下文路由避免每次动作更新都重新生成未来。

  2. HuggingFace Daily Papers(社区热门论文)43

    Rolling-WAM:带滚动想象的世界动作模型

    Rolling-WAM 将视频-动作联合去噪分散到连续的重规划周期中,通过滑动窗口在不同噪声水平上维护视频-动作块,每步完整去噪即将执行的动作块、部分精炼更远的未来块。在 LIBERO、RoboTwin 和真实 Unitree G1 人形机器人上,该方法取得有竞争力的操作性能,相比标准联合 WAM 实现 4.5 倍稳态重规划加速。

  3. Microsoft Research 博客(RSS)78

    微软研究院:机器人推理卸载至边缘/云端可显著提升性能与续航

    微软研究院发布关于物理AI机器人推理基础设施的研究。通过系统评估移动操作任务,发现将推理从机载GPU卸载至边缘或云端,能解决机载算力限制模型规模、导致响应延迟(最高383%)及精度下降的问题。实验显示,卸载推理不仅提升了任务成功率,还通过替换高功耗机载GPU为轻量硬件(如树莓派),使机器人电池寿命延长高达160%。此外,微软推出了基于Kubernetes的Physical AI Toolchain工具集,支持自动化容器化与分布式推理部署。

9月23日周三
9月21日周一
  1. HuggingFace Daily Papers(社区热门论文)43

    D-JEPA:面向决策对齐的潜在世界模型

    D-JEPA 是一种决策对齐的潜在世界模型,通过学习已执行结果中候选未来之间的决策相关关系,弥补预测精度与决策质量之间的"决策局部预测差距"。它在 PushT 上达到 87.89% 成功率,在 RoboTwin 上平均提升 15.04 分,在物理机器人任务上提升 17 分。该方法兼容 JEPA 未来表征,可通过原生潜在距离规划部署。

  2. IT之家(RSS)53

    IDC 报告:2026 上半年全球四足机器人出货量超 4.9 万台,同比增长 92.5%,宇树、云深处、智元等中国厂商领先

    IDC 发布《全球四足机器人市场份额,1H26》报告,2026 上半年全球四足机器人出货量超 4.9 万台,同比增长 92.5%,市场规模超 4 亿美元。教育科研和家用消费贡献约 60% 出货量但收入不足三分之一;行业级应用市场规模超 2.7 亿美元,同比增长 125.1%,部署量同比增长 260.5%,云深处科技位居行业级应用市场首位。

  3. HuggingFace Daily Papers(社区热门论文)45

    Tactile-JEPA:面向分布式触觉传感器的拓扑感知自监督学习

    该研究提出 Tactile-JEPA,一种针对分布式电子皮肤(e-skin)的自监督预训练方法。它利用传感器连接图指导空间掩码,通过预测被掩码传感单元的嵌入来学习拓扑感知表示。在三个数据集上的实验显示,相比先前 SOTA,该方法将力估计误差降低 6.3%,手内方向误差降低 20.8%。代码已开源。

9月19日周六
9月18日周五
  1. HuggingFace Daily Papers(社区热门论文)45

    VLA-Precision:面向真实世界在线强化学习的非对称协同自举框架

    针对预训练视觉-语言-动作(VLA)模型在精确任务中不可靠及在线强化学习存在的价值信号不稳定与大模型开销瓶颈,提出 VLA-Precision 框架。该框架包含 ACoB 算法与 ACoB-Stream 架构,通过跨时间尺度的非对称协同自举抑制策略漂移,并实现状态解耦与按需流式处理以提升效率。在九项高精度化学任务评估中,该方法达到 98.3% 平均成功率,吞吐量提升高达 10.9 倍。

9月12日周六
9月8日周二
9月3日周四
  1. HuggingFace Daily Papers(社区热门论文)44

    模仿学习能否保持灵巧操作的时间鲁棒性?专家与学习者在不同任务执行速度下的对比

    论文在 ParcelStow 接触密集任务中对比脚本专家与基于 ACT 训练的模仿策略在不同加速倍数下的表现,发现两者在名义速度下均为 100% 成功,但在最大演示速度下专家成功率为 84%,ACT 仅 53%,且两种不同参数初始化的 ACT 策略分别下降 34 和 48 个百分点,专家仅下降 16 个百分点。

9月2日周三
  1. HuggingFace Daily Papers(社区热门论文)45

    DroneCATS:评测多模态大模型作为无人机通用视觉-语言-动作智能体

    论文提出 DroneCATS-Agent 架构和 DroneCATS 基准,将多模态大模型直接放入无人机控制回路,无需微调或函数调用,评测接近、跟踪、视外搜索和多机指挥四项能力。结果显示小型开源模型导航成功率常高于前沿模型,却因过早或从不宣布到达而失败;模型的视觉空间感知尚可,瓶颈在于维持动作协议并正确发出终止动作。

  2. HuggingFace Daily Papers(社区热门论文)38

    RoboTok:面向人类示范检索与灵巧操作学习的互联网规模数据引擎

    论文提出 RoboTok,一个互联网规模数据引擎,输入人类操作视频即可从网络视频中检索与操作相关的人类示范,用于训练灵巧机器人策略。方法基于估计的演员中心参考系中的 3D 手部轨迹学习潜在运动空间,使操作行为的比较不受相机视角、场景外观和演员遮挡影响,并支持互联网规模视频的高效搜索与持续索引。在检索基准和下游策略评估中,RoboTok 检索出更相关的示范并提升了下游任务成功率。

9月1日周二
  1. HuggingFace Daily Papers(社区热门论文)47

    LightNav-0:激发 VLM 空间智能的通用具身导航模型

    研究团队发布 LightNav-0,一个紧凑的通用具身导航模型,通过双通道指向和残差向量量化动作 tokenizer 激发预训练 VLM 的空间智能,无需任务专用预测头。训练语料覆盖 2K+ 场景和 4K+ 小时具身导航数据,LightNav-0 在全部 10 个公开导航仿真环境中取得单目成功率 SOTA,真实世界评测显示跨机器人本体、场景及静态动态目标的零样本泛化能力。

  2. HuggingFace Daily Papers(社区热门论文)45

    Lucida:面向可组合真实到仿真场景建模的解析、生成与放置框架

    Lucida 提出可组合真实到仿真场景建模方法,将真实室内场景恢复为按观测排布、可单独操作的完整可编辑物体资产。方法沿用解析、生成、放置三步,但把精度要求重新分配到流水线末端:解析视频生成携带逐实例多视角证据的场景图,据此生成完整资产,并用 VLM 策略 GizmoAct 将放置建模为多轮 GUI 交互,闭环操纵物体 gizmo 并自行判断对齐完成。