HuggingFace Daily Papers(社区热门论文)·· 2026-09-01AI 评分45
DroneCATS:评测多模态大模型作为无人机通用视觉-语言-动作智能体
Evaluating Multimodal LLMs as Generalist Vision-Language-Action Agents for Drone Control: Commanding, Approaching, Tracking and Searching
AI 导读
论文提出 DroneCATS-Agent 架构和 DroneCATS 基准,将多模态大模型直接放入无人机控制回路,无需微调或函数调用,评测接近、跟踪、视外搜索和多机指挥四项能力。结果显示小型开源模型导航成功率常高于前沿模型,却因过早或从不宣布到达而失败;模型的视觉空间感知尚可,瓶颈在于维持动作协议并正确发出终止动作。
整理与数据来源:AIHOT
来源:HuggingFace Daily Papers(社区热门论文) · arxiv.org