ConceptFormer: Learning Adaptive Latent Concepts for Query-Document Alignment in Visual Document Retrieval
Peng Chunyi, Xu Zhipeng, Yan Yukun, Liu Zhenghao, Yu Shi, Mei Sen, Sun Yubo, Zhang Yongheng, Zhou Jie, Gu Yu, Yu Ge, Sun Maosong
cs.CV, cs.IR
2026-08-16
清华东北大学团队给视觉文档检索器加了一条训练期隐概念通道:用大 VLM 定位证据区域、按覆盖动态定概念长度,推理时零开销,六个基准平均 NDCG@10 比最强视觉检索基线相对提升 16.7%。
多模态 RAG 的第一步是从一堆文档页面截图里找出与问题相关的页。主流做法是把整页图像编码成一个向量,用页级对比学习(InfoNCE)训练查询与页面的相关性。这种监督有个盲区:它只告诉模型这页相关,不告诉它相关在哪。真去查「新西兰 2011 半决赛得了多少分」,模型需要同时锁定页面顶部的赛事年份语境和中间圆环图里的具体数字,页级监督给不了这种定位。
已有的细粒度方案两派各有缺陷。文本描述派(把证据区域转写成文字)丢图表与空间结构;区域裁剪派(拿视觉区域当证据)缺全局语境。这篇的判断是:证据不该用文字或图像哪一方表示,该用一个连续的中间层。
ConceptFormer 在标准检索器上外挂一条训练期隐概念通道。流程四步:
推理时隐概念通道整个关掉,走的还是原始检索管线,零额外开销。这是设计上最讨巧的一点。
训练集约 3.8 万查询-文档对,评测六个基准:InfoVQA 域内,ChartQA、SlideVQA、TQA、OWID Charts、Wikimedia Maps 域外。
| 方法 | 平均 R@10 | 平均 NDCG@10 |
| NV-Embed-v2(OCR 文本最强) | 73.66 | 62.24 |
| VisRAG-Ret(视觉最强) | 77.11 | 63.48 |
| ConceptFormer(Phi3V 底座) | 80.08 | 67.00 |
| ConceptFormer(Qwen2.5-VL 底座) | 88.33 | 75.97 |
对最强视觉基线与最强 OCR 基线的平均 NDCG@10 相对提升分别是 16.7% 与 22.1%。空间分布证据上差距最夸张:Wikimedia Maps 的 NDCG@10 到 61.69,是此前最强视觉检索器(29.04)的两倍多。Phi3V 弱底座也能超最强基线约 4 个点,说明增益不全来自底座规模。
消融把机制拆开了。文本概念代理(74.85)与视觉概念代理(72.81)都低于完整方法(75.97),隐概念确实处在两者都够不着的中间位置;去掉 KL 损失退到 74.22,等于回到页级对比学习。容量分析显示隐概念长度需求长尾分布:过半样本不超过 64 个 token,中位数 50,15.1% 要 129 到 256 个,7.9% 超过 256,P90 到 224;固定长度怎么调都不如自适应分配,且长度增加不单调涨分,排除了「更多 token 就更好」的解释。损失权重 λ 取 0.2 最优,过了就开始掉,对齐压太狠会伤判别信号。案例可视化显示 InfoNCE-only 模型激活一堆视觉显著区域但接不上语境,ConceptFormer 同时点亮顶部年份区与中心图表区。
对做企业文档 RAG 的团队,这是不增推理成本拿检索质量的路线:训练期借大 VLM 的定位能力,部署期完全无感。隐概念长度按证据覆盖自适应的思路,对其他需要「容量随难度变」的表示学习任务也有参考价值。代码与数据开源,Phi3V 与 Qwen 两种底座都验证过,替换门槛不高。
渐进改进的定位要诚实:它是给现有检索器加监督信号,不是新架构,收益的量级在几个点到一倍多之间,且集中在视觉结构重的域。
训练依赖一个强 VLM 做证据提议,提议质量直接封顶概念质量,论文没有测提议噪声的敏感度。3.8 万对的训练规模在当下属于小数据,更大规模下自适应容量的收益是否保持没有验证。推理期虽然零开销,但每样本的隐概念生成只在训练时发生,训练成本相对纯 InfoNCE 增加多少没有披露。六个基准里 InfoVQA 是域内,其余五个域外,但训练集覆盖了五类文档来源,「域外」的跨度有限。Wikimedia Maps 上的翻倍收益部分因为基线在此域本来就弱(29.04),基数效应放大了相对提升。方法绑定 patch 网格投影,对不产生规则视觉网格的检索器架构适用性未讨论。