将视觉语言基础建模为双向概念对应,统一多项定位任务

RanjayKrishna · x · 2026-08-14

传统视觉语言基础通常被简化为单向定位问题(即给定文本找图像区域),忽略了确定文本中哪些部分具有视觉指代性的挑战。

论文《Vision-Language Grounding as Bidirectional Concept Correspondence》提出将其公式化为双向概念对应:在给定图文对的情况下,恢复视觉指代文本片段与实例级图像分割之间的所有对应关系,无需预先提供相关文本。该方案统一了短语定位、指代表达式定位和开放词汇检测等常见任务。

作者推出了基于预训练 VLM 的 ConCor-1 模型,利用可学习的“桥接 token”表示候选图文对应关系,并为每个 token 预测文本掩码、图像掩码及对应存在得分。

所属事件:ConCor-1以双向概念对应重构视觉语言定位(2 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →