Vision-Language Grounding as Bidirectional Concept Correspondence
Jieyu Zhang, Ziqi Gao, Luke Zettlemoyer, Ranjay Krishna
cs.CV, cs.AI, cs.CL
2026-08-08
ConCor 把视觉定位重新定义成双向对应:用 385 个 bridge token 同时预测文本片段、图像实例和两者配对,COCONut 上 JointF1 比最强基线高 48 个点。
视觉语言定位(grounding)大多被当成单向定位问题:给一句预先指定的短语或类别名,在图里框出对应区域。这假设了「文本里哪部分该被定位」是已知的,但真实交流里这恰恰是未知量。一句话里哪些词在指图里的东西、指哪个实例、怎么对应,听的人得自己判断。现有方法把这个判断外包给了用户,模型只管执行最后一步。
ConCor 的作者(华盛顿大学加 Meta FAIR)把这个任务重新定义成「双向概念对应」:给定一张图和一段文本,同时找出文本里所有可视指代片段、图像里所有实例分割块,以及两者之间的全部配对。这样一个公式统一了三个老任务:短语定位(给定文本片段找区域)、指代表达(给查询找目标)、开放词表检测(类别名当文本)。
模型叫 ConCor-1,骨干用一个预训练视觉语言模型 Qwen3.5-0.8B,但只当编码器,不逐 token 自回归生成。
核心是一组 385 个可学习的 bridge token(桥接令牌),排成 1×1 到 10×10 的多尺度空间网格,拼在视觉 token 和文本 token 后面。每个 bridge 通过自注意力同时看两边,然后经过三个预测头:
训练时用匈牙利匹配把真值掩码分配给 bridge token,按多尺度网格单元的 IoU 来配,这让每个 bridge 自带「负责图里这块区域、这个尺度」的先验,而不是按光栅顺序硬分。损失是文本掩码 BCE 加图像掩码 PointRend 风格(BCE 加 Dice)加存在 BCE。整个预测是非自回归的,一次前向出全部对应。
作者的设计选择有道理可讲:为什么不用现成的检测器(像 Grounding DINO)或分割模型(像 SAM)?因为它们都是单向的,假设文本或查询已经给好;为什么不用自回归 VLM(像 Florence-2)?因为它逐 token 生成、难以一次性吐出所有实例级掩码。bridge token 借鉴的是检测器里 query 的思路,但让它同时预测文本侧和图像侧。
训练用了 GoldG、COCO、ADE20K 等,8 张 H100、10 万步。
| 数据集 | 指标(JointF1) | ConCor-1 | 最强基线 | 基线类型 |
| COCONut-PanCap | JointF1 | 88.8 | 59.9 | Qwen3.5-FT |
| Flickr30k | JointF1 | 91.4 | 81.6 | GDINO+SAM |
| GroundedRef | JointF1 | 70.3 | 51.5 | Qwen3.5-FT |
| LVIS-minival(零样本) | JointF1 | 29.9 | 约 23.1 | 无 |
| EntitySeg | JointF1 | 49.8 | 29.4 | MM-GDINO+SAM |
COCONut-PanCap 上比最强基线(Qwen3.5-FT,用同样数据微调)高 48 个绝对点(59.9 升到 88.8);LVIS 这种大词表零样本设定下相对提升约 29%,而且能把整张类别表一次前向处理完,不用像 GDINO+SAM 那样分块。消融里多尺度空间分配(52.4)明显优于光栅顺序(43.4),双向注意力优于因果注意力(51.3 对 49.3)。
作者还做了内部探针:ConCor 的文本-图像注意力在第 20 层的 Attn-IoU 是 0.57,而微调前的 Qwen3.5 只有 0.21,说明这套训练让模型内部真的「对上了」两边。
对做视觉语言的人,ConCor 的贡献是改了问题定义:从「由用户指定要找什么、模型去框」变成「模型自己判断文本里什么值得找、图里有什么、怎么配」。这一改让一个模型同时顶三个任务,并且在零样本大词表检测这种实际场景里更省事。
局限也跟着来:它把定位、分割、对齐三件事揉在一个非自回归头里,mask 质量比不过专门做检测或分割的模型,作者明说这只 head 是为「对应」设计的,不是为纯分割精度。
作者承认三点。一是分割质量落后于专门的检测分割模型;二是依赖「对应风格」的监督(同时有文本掩码和图像掩码的标注),转换来的数据集会带噪声;三是现有 benchmark 还测不出更长、更组合化的 caption(多个实体、重复指代、嵌套引用、属性关系、语篇共指),而这些恰恰是双向对应最该发力的场景。论文定义了一个更难的任务,但用来评它的数据集还停在简单设定上。