将视觉语言基础建模为双向概念对应,统一多项定位任务
RanjayKrishna · x · 2026-08-14
传统视觉语言基础通常被简化为单向定位问题(即给定文本找图像区域),忽略了确定文本中哪些部分具有视觉指代性的挑战。
论文《Vision-Language Grounding as Bidirectional Concept Correspondence》提出将其公式化为双向概念对应:在给定图文对的情况下,恢复视觉指代文本片段与实例级图像分割之间的所有对应关系,无需预先提供相关文本。该方案统一了短语定位、指代表达式定位和开放词汇检测等常见任务。
作者推出了基于预训练 VLM 的 ConCor-1 模型,利用可学习的“桥接 token”表示候选图文对应关系,并为每个 token 预测文本掩码、图像掩码及对应存在得分。
所属事件:ConCor-1以双向概念对应重构视觉语言定位(2 条相关)→
「研究」频道最新
- 分析数千小时 agent 运行:LLM 评委测进度强,抓偷懒弱 — hrishioa · 2026-09-21
- Program-as-Weights:0.6B 模型本地性能媲美 32B 提示,内存仅 1/50 — yuntiandeng · 2026-09-21
- 深度学习不确定性量化系统综述:安全关键场景的关键短板 — burkov · 2026-09-21
- PAW 新玩法:描述任务即可编译出本地可复用的 CPU 函数 — yuntiandeng · 2026-09-21
- HEAL:多模态幻觉源于「协同头」信息分布漂移,注入校准因子可缓解 — SUAT-SZ · 2026-09-21
- 训练自适应卷积稀疏编码:稀疏系数可微化,扰动下鲁棒性大增 — SUAT-SZ · 2026-09-21