ConCor-1 模型重塑视觉语言对齐,零样本 F1 提升 29%

raivn · hf · 2026-08-11

现有视觉语言定位通常被简化为单向定位问题(给定文本找图像区域),而忽略了确定文本中哪些部分具有视觉指代意义这一基础挑战。

论文将定位重新定义为图像-文本对上的双向概念对应问题:在不预设相关文本片段的前提下,恢复视觉指代文本跨度与实例级图像分割之间的所有对应关系。这统一了短语定位、指代表达定位和开放词汇检测等常见任务。

为此,研究人员推出了基于预训练视觉语言模型的 ConCor-1。它引入可学习的“桥接标记”来表示候选项,并预测文本掩码、图像掩码及对应分数。实验表明,ConCor-1 表现稳定,在长描述数据集上的对应 F1 分数提升了 48%,在零样本 LVIS 上提升了 29%。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →