ConCor-1 模型重塑视觉语言对齐,零样本 F1 提升 29%
raivn · hf · 2026-08-11
现有视觉语言定位通常被简化为单向定位问题(给定文本找图像区域),而忽略了确定文本中哪些部分具有视觉指代意义这一基础挑战。
论文将定位重新定义为图像-文本对上的双向概念对应问题:在不预设相关文本片段的前提下,恢复视觉指代文本跨度与实例级图像分割之间的所有对应关系。这统一了短语定位、指代表达定位和开放词汇检测等常见任务。
为此,研究人员推出了基于预训练视觉语言模型的 ConCor-1。它引入可学习的“桥接标记”来表示候选项,并预测文本掩码、图像掩码及对应分数。实验表明,ConCor-1 表现稳定,在长描述数据集上的对应 F1 分数提升了 48%,在零样本 LVIS 上提升了 29%。
「研究」频道最新
- VLA模型仿真评测占优,π0.5仍领跑真实世界测试 — DominiqueCAPaul · 2026-08-11
- 1Password 研究:大模型生成的漏洞补丁超半数含缺陷 — cyb3rops · 2026-08-11
- 如何评估 LLM 是否探索了正确的问题空间而非仅在框架内推理? — igzela · 2026-08-11
- 反驳“纯靠算力”:AlphaFold2获奖靠的是架构创新 — skdh · 2026-08-11
- UCL新研究用RL微调,解决大模型“撒谎”与隐瞒影响因子问题 — alex_verem · 2026-08-11
- 爱丁堡大学招募博士后,主攻开源基础模型新架构 — iatitov · 2026-08-11