CLIP按外观检索会认错实体,清华KBMR把InfoSeek的R@1抬了14.7分

Beyond Visual Similarity: Entity-Aligned Retrieval for Knowledge-Based Visual Question Answering

Hangrui Xu, Zhengxian Wu, Yunyao Yu, Zhuohong Chen, Rui Cong, Xiangwen Deng, Zhifang Liu, Peng Jiao, Haoqian Wang

cs.CV

2026-08-20

知识型视觉问答的第一跳别再只靠CLIP长得像。清华KBMR用MLLM嵌入加连续语义蒸馏,InfoSeek上R@1相对最强CLIP高14.7分,端到端最高+9.4。

这篇在解决什么

知识型视觉问答(KB-VQA)要回答的问题,图片里往往没有:这座酒店现在归谁、这种鸟在园子里怎么觅食。标准做法是 RAG:先用图去维基百科量级的图文库里找回同一实体,再让多模态大模型对着证据答题。

第一跳检索几乎全是 CLIP 式双塔。CLIP 擅长「长得像」,KB-VQA 要的是「是同一个实体」。同一座建筑早晚光影差很大,两种乌鸦外形又很近。候选池一旦错了,后面的重排、反思、工具增强都是在错池子里翻。已有系统(Wiki-LLaVA、ReflectiVA、Wiki-PRF)主要在检索之后加模块,检索器本身还是 CLIP。

方法

KBMR 把检索器换成 MLLM 嵌入模型,据称是 KB-VQA 上第一个这么做的。训练分三块。

表示:给 MLLM 一张图,提示「Summary above image in one word:」,取最后一个 token 的隐状态当检索向量。和 CLIP 双塔不同,视觉和指令进同一个自回归语义空间。

监督:维基规模检索的正负样本很吵。先用 EVA-CLIP 给每个 query 取 top-50 外观近邻(去掉真正的正例)当潜在难负样本。再用一个冻结的 MLLM 当 Semantic Discriminator(SD):问「Candidate 和 Query 是不是同一实体」,用 Yes/No 的 logit 做成连续的实体一致性权重 w=σ((zyes-zno)/γ)。权重高于「query-正例权重减一个边距」的候选被丢掉,剩下的按权重大小分成四档难度,每档抽 2 个,凑满 8 个难负样本。

训练:普通对比学习把正例当 1、其余当 0。KB-VQA 的难负样本并不同等无关。KBMR 把 SD 权重和检索相似度都做成温度 softmax 分布,再用对称 KL 把检索后验拉向 SD 的软先验,叫 continuous semantic distillation。γ 取 1.1。

实现上,SD 用 Qwen2.5-VL-7B,检索器分别训 Qwen2-VL-7B 和 LLaVA-OneVision-7B,LoRA rank 16,8×A100,336×336,累积 batch 1024,60 万样本、5000 step。推理时只跑训好的检索器做相似度搜索。

结果

检索:E-VQA 上 KBMR(LLaVA-OV-7B)R@1 24.7,高于最强 CLIP(EVA-CLIP-8B 的 13.3)11.4 分,高于最强零样本 MLLM 检索器 12.8 分。InfoSeek 上 R@1 60.3,相对 EVA-CLIP-8B 的 45.6 高 14.7 分,相对最强零样本 MLLM 高 19.0 分。零样本 MLLM 嵌入普遍弱于强 CLIP,说明「会看图」推不出「会检索实体」。

端到端:只换第一跳、其余管道不动。EchoSight 加重排后 E-VQA 全体 41.8→51.0(+9.2);OMGM 到 54.7 / InfoSeek 50.8,两个基准的新高。InfoSeek 上 MMKB-RAG 的 Unseen-E 36.3→45.7(+9.4),对应摘要里端到端最大增益。OK-VQA 上把 KBMR 的第一跳塞进 OMGM,VQA 分数 66.6→79.3(+12.7),超过 Wiki-PRF-7B 的 77.8。

消融:同样 8 个难负样本,随机+one-hot 在 E-VQA R@1 只有 9.1;CLIP 难负+one-hot 14.7;SD 难负+one-hot 16.4;SD 难负+SD 软权重 24.7。把 30% 的 SD 权重反过来,掉到 12.1,比 one-hot 还差。SD 对「是否同一实体」的 AUC 是 0.91,CLIP 相似度 0.79。难负样本数 8 最好,10 不再涨。SD 用 Qwen2.5-VL-7B 略强于 InternVL3-14B。

检索器E-VQA R@1InfoSeek R@1
EVA-CLIP-8B13.345.6
LLaVA-OneVision 零样本7.421.8
KBMR (LLaVA-OV-7B)24.760.3

为什么重要

KB-VQA 管道里,第一跳比再堆一个重排器更值钱。这篇把「实体对齐」从后处理挪进检索空间,并且用连续权重代替 0/1 对比,对长尾、外观变化大的实体更对症。工程上可以即插:EchoSight、ReflectiVA、OMGM 都只换检索器就涨。

代价也很明确。检索器是 7B 级 MLLM,推理比 CLIP 重一个数量级;论文没报延迟和吞吐。训练还要再挂一个 7B SD 当老师。这是用算力换候选池质量,不是免费午餐。

局限与存疑

论文没有独立的局限节,下面几条是读下来站不住或没验证的地方。

难负样本池仍然从 EVA-CLIP 的 top-50 里挖,CLIP 看不到的实体,SD 也没有机会标。知识库评估用 10 万条维基条目,不是全库。图被缩到 336×336,细粒度物种差可能已经糊了。E-VQA、InfoSeek、OK-VQA 的训练集抽了 60 万样本来训检索器;InfoSeek 验证集按实体和问题切分,E-VQA 报的是测试集,但实体级泄漏风险论文没系统审计。MMKB-RAG 的对照是作者复现,不是官方数。SD 自己也会错(AUC 0.91),软标签会把老师的偏见蒸进学生。优先权声明「第一个用 MLLM 做 KB-VQA 检索器」依赖作者对文献的覆盖,通用 MLLM embedding(VLM2Vec、GME、MM-Ret)已经存在,这篇的差异是任务适配和蒸馏目标,不是「MLLM 也能出向量」这件事本身。

术语

原文与代码

相关论文

全部论文解读