检索越多越错:扩散语言模型视觉 RAG 撞证据冲突,免训练 ECF 平均涨 2.62 点

Does More Retrieved Evidence Help Visual Retrieval-Augmented Generation with Diffusion Language Models?

Jiankun Wang, Yisen Gao, Ziwei Zhang, Xingcheng Fu, Jiaxin Bai, Chen Gao

cs.CL, cs.CV

2026-08-07

视觉 RAG 默认「检索越多越好」,但对扩散语言模型(DLM)恰好相反:答案页召回上去了,准确率反而掉,根因是多源视觉证据在并行去噪里拼出不兼容答案。ECF 用首步块熵做免训练的证据准入,三个 DLM、五个 VQA 基准平均涨 2.62 个百分点。

这篇在解决什么

视觉检索增强生成(RAG)有个默认假设:检索回来的证据越多,覆盖到答案所在页的概率越高,所以应该把检索到的页全喂给生成模型。对自回归模型这基本成立。但这篇发现,对扩散语言模型(DLM)这条假设是反的,检索页越多,答案页召回确实涨,准确率却经常掉。

DLM 不像 GPT 那样从左到右逐 token 生成,它把整段答案里所有未定位置同时并行去噪。当多张检索页同时约束这些位置时,逐位置的提议可能把来自不同源、彼此不兼容的视觉信息拼到一起,凑出没有任何一页真正支持的「混合答案」。作者用受限的潜源分析证明(Theorem 1):在因子化提议下,这种混合答案的质量 Q∥(ℋ|E)=1−(1−ϵ)^r−ϵ^r,会随冲突宽度 r 单调上升。冲突页越多,错误越被放大。

关键是可以提前发现:这种干扰在去噪的第一步就显现了。在 ChartQA 上,加入冲突页会让首步答案块准确率从 65.0 掉到 41.1,与正确源分布的 Jensen-Shannon 散度也最大。

方法

ECF(Entropy-Based Candidate Filter)是个免训练的证据准入框架,核心是用 DLM 自己首步的块熵来判断每条候选证据该不该进上下文。

每次探测只需要一次首步前向传播,不用跑完整去噪,也不依赖检索器的分数或任何学到的参数,所以免训练。

结果

三个多模态 DLM(LLaDA2.0-Uni、LLaDA-V、Dream-VL)、五个视觉问答基准(ChartQA、InfoChartQA、DocVQA、InfoVQA、TATDQA)。ECF 在全部 15 个模型与基准的组合上,平均比最强固定 top-k 输入涨 2.62 个百分点。

以 LLaDA2.0-Uni 为例,ECF 对比几种免训练方案:

方法ChartQAInfoVQATATDQA
固定 top-224.6030.1211.52
Answer-UQ top-130.7236.0814.08
ECF31.1242.6018.96

ECF 对 LLaDA2.0-Uni 平均比每个数据集上最强的免训练对手还高 2.37 个百分点。候选池扩大到 k=4、k=5 时,宏观准确率仍稳定在 30.19、30.32(k=3 为 30.11),不会因为池子变大而崩。

为什么重要

检索增强现在几乎是多模态大模型的标配,而扩散语言模型正被当作自回归之外的一条主流生成路线。这篇指出这两者搭在一起有一个结构性矛盾,并给了一个轻量、即插即用的修法:与其无脑全喂,不如让模型首步的熵当门卫。对做 RAG 系统的人,ECF 不需要重训、不依赖特定检索器,可以直接接到现有流水线上试。

局限与存疑

Theorem 1 的对齐是刻意「局部」的:在正确源盆地之外,低熵可能反映一个「自信但错误」的源,所以才需要检索排序当先验补位。作者也强调,用于对比的因果构造是一个隔离依赖成本的 oracle,不能当作对模型家族的通用排名。另外实验里的 DLM 体量相对小(LLaDA2.0-Uni 等和当前最大的自回归多模态模型不在一个量级),更大 DLM 上冲突是否同等显著,论文没有覆盖。

术语

原文与代码

社区讨论

相关论文

全部论文解读