HuggingFace Daily Papers(社区热门论文)·· 20 天前AI 评分45
VLA-Precision:面向真实世界在线强化学习的非对称协同自举框架
VLA-Precision: Asymmetric Co-Bootstrapping for Efficient Real-World Online RL of Vision-Language-Action Models
AI 导读
针对预训练视觉-语言-动作(VLA)模型在精确任务中不可靠及在线强化学习存在的价值信号不稳定与大模型开销瓶颈,提出 VLA-Precision 框架。该框架包含 ACoB 算法与 ACoB-Stream 架构,通过跨时间尺度的非对称协同自举抑制策略漂移,并实现状态解耦与按需流式处理以提升效率。在九项高精度化学任务评估中,该方法达到 98.3% 平均成功率,吞吐量提升高达 10.9 倍。
整理与数据来源:AIHOT
来源:HuggingFace Daily Papers(社区热门论文) · arxiv.org