ConCor-1:将视觉-语言定位重构为双向概念对应

RanjayKrishna · x · 2026-08-14

研究者提出ConCor-1,重新审视视觉-语言定位任务。传统方法单向地由语言指导模型在图像中定位,而ConCor-1将定位建模为双向概念对应:模型同时发现语言和视觉中的指称概念,并显式恢复其对应关系,无需预先给定文本跨度。作者认为这从回答“在哪里”转向理解语言与视觉之间的完整对应结构。ConCor-1是第一步,团队正在扩展该方向。

所属事件:ConCor-1以双向概念对应重构视觉语言定位(2 条相关)→

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →