开放词表遥感定位基准:172 类三千查询,最强模型 IoU 不到 42%

OVEarth-Bench: Evaluating Category Breadth and Query Diversity for Open-Vocabulary Earth Observation

Kaiyu Li, Zepeng Xin, Zixuan Jiang, Jing Fu, Lanxuan Xue, Lingyu Zhang, Xiangyong Cao

cs.CV

2026-07-29

用 172 个层级类别、三千多条词表/指代/推理查询考遥感开放词表定位,49 个模型零样本评测最强 ma-IoU 仅 42%,通用多模态大模型普遍压过遥感专用模型。

这篇在解决什么

地球观测(Earth Observation, EO)图像里的开放词表定位,目标是让模型按一句自然语言把遥感图里对应的地物圈出来,而不是只认预训练里见过的那几个固定类别。

现有基准考不了这件事。它们大多直接拿传统遥感数据集改一改,类别少、问法单一:有的只测词表短语,有的只测指代表达,几乎没有同时覆盖「词表 + 指代 + 推理」三种问法的。一个模型在这种窄基准上刷到高分,未必真有开放词表能力,更可能是恰好在那一小撮类别上记得牢。OVEarth-Bench 想把这条缝补上,既要类别铺宽(细粒度、长尾、带负样本),又要问法铺开。

方法

基准用新采集的遥感图搭起来,172 个层级类别,覆盖土地覆盖、交通、工业设施、公共服务、农业结构。三类查询对应三种能力:

体量上,1,346 条词表短语(425 正 + 1,029 负)、732 条指代表达、1,056 条推理查询;590 张人工 mask 来自 520 张图,4,810 个检测框,其中 91.8% 的框面积不到整图 1%,是个典型的小目标密集场景。

查询不是纯靠人写,而是两阶段 LLM 流水线:先拿类别名 + 图 + mask 让 LLM 生成短语、指代、推理和负样本候选,再由人工审一遍,确认负样本确实不在图里、指代和推理确实唯一指向目标。所有评测统一走零样本协议,mask 和框(水平框 HBB、旋转框 OBB)两套定位形式都支持,共评测 49 个模型变体。

结果

49 个模型零样本跑下来,headline 数字很冷:三类查询最好的分割 ma-IoU 分别只有 38.75%、41.32%、37.96%,全靠 Rex-Omni+SAM 打出来。最好的框定位 [email protected] 只有 24.53%、35.56%、26.12%。

查询类型最佳 ma-IoU最佳模型
词表38.75%Rex-Omni+SAM
指代41.32%Rex-Omni+SAM
推理37.96%Rex-Omni+SAM

三条结论比绝对分数更值得关注。第一,基于多模态大语言模型(MLLM)的方法全面领先:词表榜前十占九席,指代和推理榜前十全包揽。第二,遥感专用模型没占到便宜,词表榜前十只有一个遥感专用模型入围,指代、推理榜一个都没有,最好的遥感专用成绩离榜首还差 7 到 15 个 IoU 点。第三,类别集一收窄排名就乱:只抽 5 个类别时,与全类别排名的中位 Spearman 相关性只有 0.84,前五名只能保住三个;扩到 20 个类别升到 0.95、保住四个;50 个类别才到 0.98。

还有一条容易被忽略:定位准不等于会拒绝。模型在正样本上 mask 画得准,跟它能不能正确判断「这个类别图里压根没有」只是弱相关。换句话说,产生幻觉式定位的风险被低估了。

为什么重要

对做遥感感知的人,这条最实用:如果你一直在小类别集上比模型,排名可能就是噪声。把评测类别铺宽,排序才稳。

通用 MLLM 压过遥感专用模型,指向一个判断,基础模型的预训练广度比领域微调更值钱。想做出更强的开放词表遥感模型,与其在窄域数据上继续调,不如把通用 MLLM 的语义广度跟遥感特有的空间能力(多尺度高分辨率编码、方向感知解码)拼起来。而「这个地物在不在图里」该当成一个独立的、带校准的训练目标,别默认定位模型顺带就做对了。

局限与存疑

论文自己承认几条。结论是描述性的不是因果性的:各模型的训练数据、规模、输出接口、推理预算都不一样,「MLLM 更强」到底是因为范式、还是因为模型更大更新,分不开。数据集偏小,590 张 mask,部分类别只有一两个样本,类别级结果对个别样例很敏感。检测对比主要用水平框,能输出旋转框的方法不多,方向感知定位这块下不了结论;评测聚焦类别层面,没评估层级结构里不同粒度的定位。

读完最大的存疑和论文一致:Rex-Omni、X2SAM、SAMTok 这几个榜首模型,同时是评测里最大、最新的几个,「MLLM 胜出」里掺了多少是规模红利、多少是范式优势,这个基准本身回答不了,需要受控消融才能拆开。

术语

原文与代码

相关论文

全部论文解读