答对不等于看了图:反事实证据审计让 VLM 9 项基准平均涨 5.94 分

Evidence-RL: Towards Evidence-intensive Visual Reasoning

Haojie Huang, Xinlei Yu, Chengming Xu, Zhangquan Chen, Cheng Yang, Qingdong He, Yu Yang, Jiangning Zhang, Xiaobin Hu

cs.CV, cs.AI

2026-08-08

Evidence-RL 训练时抹掉候选证据区、看答案概率掉多少,只奖励真正依赖图像的回答;9 项基准、4 个 backbone 全部不退步。

这篇在解决什么

视觉语言模型(VLM)经常「答对了但没看图」。问一张图里有几个轮子,模型可能根本不扫一眼,直接吐出「轿车有四个轮子」这种先验答案。这种走捷径在计数、空间关系、细粒度识别这类任务上尤其明显,模型靠语言常识和训练集的统计规律蒙混过关。

已有的一些感知增强后训练方法想治这个毛病,做法是对整张图做扰动、或者拿注意力分布当代理信号,逼模型「用图」。但这些做法有个共同盲点:它们没法检验「这个具体答案到底是不是靠图像里那个特定区域撑起来的」。一条答案可以同时由三条因果路径支撑:真正的证据区、无关的视觉上下文、以及语言先验,光看对错分不出哪条路径在起作用。Evidence-RL 就是要把这个「答对的原因」拉进训练信号里。

方法

核心机制叫 Counterfactual Evidence Disentanglement(反事实证据解耦,简称 CED),做法是一次反事实审计:

关键设计是把非证据区当成本地的「零假设」:如果一个答案对任意区域扰动都同样敏感,那它敏感的只是「遮蔽」这个动作本身,不是真正的证据。只有当证据区引发的掉幅显著大于对照区,m 才会高。

最后把 m 接进 GRPO 的奖励里:R = 答案正确性 × g(m) + ε × m。正确性仍然是主梯度,但 g(m) 这个门会在「同样答对」的多个 rollout 之间制造区分,谁更依赖证据区谁拿更高分。论文给了个直白的例子:问一辆车几个轮子,两个 rollout 都答「4」,一个靠「轿车 2+2」的先验根本不看图,另一个数出「前 1 + 后 2 + 备胎 1」。CED 门给后者开出 7 倍的奖励(0.78 对 0.11),让 GRPO 倾向选那条真看图的轨迹。这套审计只在训练时跑,推理零开销。

结果

主实验在 Qwen2.5-VL-7B 上,9 个基准(计数、空间、幻觉、视觉盲点、FREAK 五个接地类,MathVista、MMMBench、MMMU、ScienceQA 四个通用推理类):

方法平均分相对基线
Qwen2.5-VL-7B 基线61.19
VAPO-Thinker60.05−1.14
VPPO63.47+2.28
PAPO-G-H63.80+2.61
SophiaVL-R163.99+2.80
Evidence-RL67.13+5.94

Evidence-RL 平均分最高、涨幅最大,9 个基准全部不退步。几个最吃视觉的基准上尤其明显:VLMsAreBlind +7.58、FREAK +14.22、MMMU +6.84。

换四个 backbone(Qwen2.5-VL-3B/7B、Qwen3-VL-8B、Qwen3.5-9B)验证,平均涨幅分别是 +4.59、+5.94、+1.33、+11.34,36 个「基准 × backbone」格子全部非负。

最说明问题的是受控消融,同一个 Qwen3.5-9B、同样的数据和算力:只奖励正确性,平均 −1.24;重训 VPPO,−1.78;重训 PAPO,直接崩到 −21.39(它的全局扰动 KL 目标让模型陷入复读循环,25% 重复段率);而 Answer-CED 做到 +11.34。换算下来 CED 单独贡献 +12.58。同样的数据和算力,只有 CED 把它们转化成了能迁移的提升。

为什么重要

VLM 圈长期有个隐疾:答对但理由错。模型蒙对了答案,你以为它看懂了图,其实它在背先验。这种模型在分布上一旦遇到反常识的图(比如一辆三个轮子的车)就翻车。CED 的价值在于它第一次把「答案是否因果地依赖正确的视觉区域」变成一个可计算的、能塞进 RL 奖励的训练信号。

实用上它很轻:训练时才审计、推理零开销、不需要逐题标注证据位置,拿现成的 COCO 框就行。论文还顺带证了一条结构结论:任何只观察答案文本的奖励,无论 judge 多强,都分不清「接地答对」和「先验蒙对」,因为两条路径都终止在同一个答案节点上,必须注入图像条件的信号才能破局。对做 VLM 后训练的人,这是一个比全局扰动和注意力代理更干净的接地信号。

局限与存疑

证据区靠 COCO 物体框这种弱先验,没有针对具体问题标注。作者承认这对属性级、关系级的证据可能覆盖不到,论文主要在物体级干预上验证。ScienceQA 上的涨幅偏小,部分原因是这个基准里有一批「白图」题,比如配一张 448×448 空白图问「一辆水泥车多重」,基线靠先验答对得分,而 CED 训练的模型会回答「无法从图中确定」被判错。这其实是 CED 在按设计行事,但拉低了表面分数。干预用均值替换能减弱伪迹但没根除。另外 CoT 版的 CED 会被模型钻空子,把推理链截短来抬高均分,所以默认用只打分最终答案的 Answer 版。

术语

原文与代码

相关论文

全部论文解读