小模型飞进5米圈却不会宣告到达,NAVER无人机评测

Evaluating Multimodal LLMs as Generalist Vision-Language-Action Agents for Drone Control: Commanding, Approaching, Tracking and Searching

Jaewoo Park, Minyoung Lee, Sukmin Seo, Moonbin Yim, Hyunwook Yoon, Dohoon Ryu, Daehee Kim, Myungseo Song, Jihyuk Byun, Seunggyu Chang, Taeho Kil, Jiseob Kim, Bado Lee, Geewook Kim

cs.RO, cs.AI

2026-09-01

NAVER把MLLM直接塞进无人机控制环,四个动作全写在prompt里。最好模型接近可见目标成功率65%;Qwen3.5-9B飞进5米圈90%次,真正宣告到达只有35%。

这篇在解决什么

现有用多模态大模型控无人机的系统,多数把模型的活越削越少:TypeFly把规划交给外部检测器,See Point Fly把控制收成「点一个像素」,Fly0只让模型做语义接地、轨迹交给LiDAR规划器,OnFly再加一层校验器拦在执行前。Fly0自己测过,GPT-5、Gemini 3 Pro、Claude 3.7、Qwen2.5-VL-32B 在纯接地任务上成功率挤在70.4%到71.5%之间。模型几乎不可区分,因为真正拉开差距的决策已经被系统拿走了。

NAVER Cloud 的 DroneCATS 把问题反过来:脚手架固定,模型当自变量。动作空间只写在prompt里,不微调、不走function calling。模型自己决定往哪飞、要不要原地转、要不要多想一步、以及什么时候说「到了」。到没到,由事后校验器拿真值距离来判,模型看不见那把尺子。

方法

DroneCATS-Agent 每步吃一张第一人称RGB、任务指令和最近五步动作,吐一个JSON。四个动作:

传感器只有单目RGB,深度是模型自己估的步长,不是测距。成功判据全网格共用:至少一次宣告发生在距目标中心三维距离≤5米且目标可见。只飞过圈、不宣告,算失败。从未宣告的失败里,337次中有61次轨迹进过圈,按轨迹接近算会把182次成功虚增三分之一。

单机80回合,接近/搜索/跟踪/搜跟踪各20,住宅区与校园各半。指挥设定再加20回合,一个上下文同时飞4架,目标是近看才能分清的车牌或标牌。九个模型从GPT-5、Claude Opus 5、Gemini 3.7 Flash到Qwen3.5的2B/4B/9B/27B和Cosmos3-Edge-2B。仿真在AirSim,回合上限300秒。

结果

最简单的格子也没解开。Gemini 3.7 Flash接近可见目标13/20成功(65%),目标一开始不在画面里掉到40%,没有任何模型超过这个数。模型排序也不稳:GPT-5接近60%,跟踪只有15%;Gemini跟踪80%。

模型接近SR接近OSR指挥N=4 SR
Gemini 3.7 Flash657080
GPT-5606520
Qwen3.5-9B359015
Qwen3.5-2B0305
Cosmos3-Edge-2B0250

OSR是轨迹进过5米圈、不管宣不宣告。Qwen3.5-9B接近任务进圈90%,比所有前沿模型都勤,转成成功只有35%,宣告时平均还在出发距离的0.63倍处。Qwen3.5-2B在出发距离1.28倍处就宣告,一次都没成功。Cosmos3-Edge-2B飞过,25%进圈,一次宣告都没有。

四机指挥把协议裂缝放大。Qwen3.5-9B在四机同时go的步里,70%吐同一个坐标;27B是58%。GPT-5、Claude、Gemini Robotics-ER 2从不这么干。Gemini 3.7 Flash单机65%到指挥80%,GPT-5从60%掉到20%。think动作整次评测被调用1797次,逐步观察看不出它系统性改写结局。

为什么重要

给「小模型能不能上机」的人一个更准的诊断。空间感知和飞过去,2B到9B已经能做相当一部分;卡住的是跨几十步守住prompt里的动作协议,尤其是那个结束回合的finished。现有系统把终止判据放在模型外面,这个缺口就不会出现在他们的数字里。谁要在机载算力上部署,该优先练的是何时停、如何对多视角分别下指令,不是再抠一个像素点得准不准。

评测本身也可用:四格子一套成功规则,模型可插拔。仿真控制率大约2Hz,论文自己说主机变慢时、尤其跟踪,成功率会跟着掉。

局限与存疑

全程仿真,没有真机。每格20回合,二项噪声大约9到11个百分点,Gemini三飞总成功43.7±7.8/80,邻居排序不要读过。指挥设定不是一对一匹配的对照,加了近距消歧、校园图换成Blocks。层级指挥(每机一个子Agent加指挥官)没评。think没有单独消融。目标按中心计距离,大物体表面读法会有偏差。

术语

原文与代码

相关论文

全部论文解读