证据归因不用坐标改用引用,幻觉率减半,召回从 8 跳到 47

Evidence Attribution in Visual Document Understanding without Coordinates or Region Labels

Zhuchenyang Liu, Yao Zhang, Yu Xiao

cs.CV, cs.CL, cs.IR

2026-07-28

让视觉文档模型用「引用原文 + 多模态检索」代替输出坐标框,证据召回从最高 8 分涨到 26-47,幻觉率减半;再用 GRPO 无区域标注训练,把 8B 模型的严格归因准确率从 22.4 提到 33.8。

这篇在解决什么

视觉文档问答里有个怪现象:模型答对了,却指不出证据在文档哪个位置。论文把这种「答对但引用错」叫做 Attribution Hallucination(归因幻觉)。现在的做法是让模型输出证据区域的坐标框(bounding box),但在一套双语的 CiteVQA 子集上,即使是 Qwen3.5-27B 这种大模型,证据召回也难得超过个位数(最高 8.1%),幻觉率高达 82-97%。

作者要回答的核心问题是:这到底是模型没有定位能力,还是输出坐标这个接口本身有问题?

方法

他们把坐标接口换成语言接口。模型不再吐坐标,而是直接把证据原文逐字「引用」出来(以 JSON 给出答案 + 引用列表);然后用一个版面解析器(MinerU)把文档切成段落、表格、图块,用多模态编码器(Qwen3-VL-Embedding-2B)给引用和版面块都编码,再用匈牙利算法做线性指派,把每条引用对应到它落在的页面区域。表格和图通过标题或注释来引用。

这套「引用 + 检索」还反过来当训练脚手架。因为长文档的区域级证据标注很贵,他们设计了一个不用任何区域标注的 GRPO 配方(用 DAPO 的非对称裁剪),奖励来自一个视觉语言判官(Qwen3.5-9B)对三个维度打分(答案正确性、证据相关性、证据覆盖度),关键是相乘结构 r = (a/5)·(erel + ecov)/10,答案错了证据分直接归零,逼模型在答对的前提下再去优化引用。

结果

在 719 题的已验证 CiteVQA 集上,六个开源 VLM 换成语言接口后,证据召回普遍从个位数跳到 26-47,幻觉率大约减半,而答案质量几乎不变(六个模型里五个波动在 2.3 分以内)。

以 Qwen3-VL-8B 为例:坐标接口下召回 0.3%、幻觉 97.0%、严格归因准确率(SAA)1.4%;语言接口下召回 39.9%、幻觉 41.2%、SAA 22.4%。再加上 GRPO 训练,召回 51.3%、幻觉 28.4%、SAA 进一步到 33.8。

接口证据召回幻觉率严格归因准确率
坐标(Qwen3-VL-8B)0.3%97.0%1.4%
语言(Qwen3-VL-8B)39.9%41.2%22.4%
语言 + GRPO51.3%28.4%33.8%

作者还做了归因(credit assignment)消融来排除「只是因为换成了更粗的块」。只把坐标吸附到版面块(snap),召回最多也才 23.5%;只拿问题去检索(query),比引用低 13-19 分;拿「问题+答案」去检索能把差距追平,说明模型把位置信息编码进了自己生成的语言里。多模态编码也比纯词法匹配(BM25)高 5-14 分。

一个被作者诚实标注的上限:版面解析器本身的召回天花板是 88.2%(IoU≥0.5),整套方法的成绩被它压着。

为什么重要

这篇最直接的结论是一个测量学警告:很多被归咎于「模型不会定位」的失败,其实是坐标输出这个接口的锅。换成引用,同样的模型立刻就能大幅恢复。对做文档问答和 RAG 系统的人,这意味着归因质量可能不需要重训大模型,换条接口路子就能拿走一大块收益;而 GRPO 配方证明了,即使没有昂贵的区域标注,也能靠判官奖励把归因能力练上去。

局限与存疑

作者列得很清楚:只覆盖单文档归因,多文档没研究;模型并不独立完成定位,靠解析器和检索把引用转成区域,所以成绩受版面解析器天花板限制;纯图形证据(没有标题或注释)无法被引用,会被漏掉;指派算法总是给每条引用返回一个块,幻觉出来的引用不会被标记出来。实验上,RL 结果是单种子单骨干,评测受 PDF 来源限制(已验证集只覆盖原始 987 题的 72.9%)。

术语

原文与代码

相关论文

全部论文解读