老师纠正仅 23% 来自视觉,VAD 拆出视觉成分再蒸馏,4B 反超 397B Qwen

VAD: Attributing Visual Evidence for Target Reconstruction in Multimodal On-Policy Distillation

Kangning Zhang, Yixing Li, Shuai Shao, Qingyao Li, Zhengxi Lu, Zhiyuan Yao, Jianghao Lin, Wenxiang Jiao, Yuan Lu, Weiwen Liu, Weinan Zhang, Yong Yu

cs.CV, cs.CL

2026-07-31

VAD 用反事实把多模态蒸馏纠正里真正来自视觉的部分拆出来重建监督目标,4B/9B 在六项细粒度视觉基准上拿到 78.32/79.93,反超 Gemini 3 与 397B Qwen。

这篇在解决什么

多模态大模型训练里有一种叫 on-policy distillation(在线策略蒸馏,OPD)的知识迁移手法:让 student 模型自己生成回答的中间状态,再用一个看过「特权视角(privileged view)」的 teacher 逐 token 纠正它。特权视角通常是把图片里和问题相关的区域裁出来放大,teacher 看得到、student 看不到,这样 teacher 把细粒度视觉能力喂给 student。

问题出在 teacher 给的每个纠正都来历不明。它混了三样东西:真正的视觉证据、语言先验(模型本来就知道的常识)、以及 teacher 自己的个性偏差。作者做了个诊断:在 student 回答里 teacher 纠正最强烈的位置上,只有 23.2%(4B)和 22.8%(9B)的纠正真能用视觉证据解释,剩下七成多是噪声。把这些纠正原样灌给 student,等于连噪声一起学。

此前的两条路线都没解决好。Vision-OPD 把 teacher 在裁剪图上的完整输出直接拿来匹配,视觉和非视觉成分照单全收;VA-OPD 只挑「证据让正确 token 概率上升」的位置加权,却漏掉一类关键信号:当证据明明说明 student 选错了,正确做法是把那个错误 token 的概率压下去,也就是反驳(refutation),VA-OPD 对这种位置给零权重。

方法

VAD(Visual Attribution Distillation)的核心是反事实归因(counterfactual attribution):与其纠结在哪蒸馏、力度多大,不如先搞清楚一个纠正到底有多少是视觉证据撑起来的。

具体分三步。

第一步,在每个 student 生成的位置上,用同一个固定的 teacher 看两张图:一张保留相关视觉证据(裁出目标区域),一张把证据抹掉或破坏。两张图对应输出的对数概率之差记作 ut,是个有方向的向量,指向「揭示证据」让 token 概率怎么变。这就是视觉证据方向的代理(proxy)。

第二步,把 teacher 的完整纠正 rt 投影到这个视觉方向 ut 上。能投上去的那部分 rt^vis 才算「视觉能解释的」,投不上的残差 rt^res 当作语言先验和 teacher 偏差丢掉。要是 rt 和 ut 方向不一致,投影系数直接归零,这个位置就不施加视觉位移。这叫单侧投影(one-sided projection),只留方向一致的支持信号。

第三步是目标重建(target reconstruction)。VAD 不直接拷 teacher 的分布给 student,起点是 student 自己当前的分布,只动那些视觉干预能解释的 token 概率。它还把视觉信号拆成两路:支持路(证据抬高正确 token)和反驳路(证据压低错误 token),各配预算,支持路设了上限 τ+,防止不确定的正向证据喧宾夺主。最后叠一个很弱的 teacher 正则项稳定优化。

这样重建出来的监督目标,起点是 student 自己,只改视觉干预解释得了的那些 token 赔率。

结果

实验在 Qwen3.5-4B 和 9B 上做,训练集是 6241 条合成的视觉问答,六个细粒度视觉基准:VStar、ZoomBench、HR-Bench(4K/8K)、MME-RealWorld(中/英),用 GPT-OSS-120B 当评判。

方法4B Avg69B Avg6
Base Qwen3.570.8573.86
GRPO71.7276.20
VA-OPD74.9276.67
V-Zero75.4277.13
Vision-OPD75.9276.88
Decomposed OPD75.3777.05
VAD78.3279.93

VAD 在两个规模上都最高,4B 比规模对齐的最强对手高 2.40,9B 高 2.80。更扎眼的是参数效率:4B 的 VAD 就超过 Gemini 3 Flash(77.32)、Gemini 3.1 Pro(78.04)和 Qwen3.5-397B-A17B(76.49)。9B 的 VAD 在六项里赢五项,只有 ZoomBench 上 VA-OPD 高出 0.35。

归因本身是不是真把视觉信号提纯了?作者做了语义分析:在投影出的视觉方向 rt^vis 里,与视觉属性、物体、A–D 选项决策相关的内容占相对 top-5 的 42.0%,而原始纠正 rt 里只有 26.7%,残差 rt^res 里更低,17.7%。离线测 token 效果,正确 token 的支持度从 7.52 涨到 7.89,错误 token 的抑制从 6.29 涨到 6.61。

代价不大。VAD 比 Vision-OPD 单步只慢 3.8%(4B)/11.1%(9B),4B 全程 67.9 GPU 小时,9B 是 96.3。泛化上,在四个没见过的任务(MMVP、CV-Bench、MMStar、POPE)上,VAD 是唯一两个规模都正向的方法(4B +0.24、9B +0.23),其余后训练方法在这些任务上多为负迁移。

为什么重要

这篇给多模态蒸馏指了个干净方向:别盲目信 teacher,先问它「这条纠正凭什么是视觉给的」。反事实的成本是两次 teacher 前向,同一张图有证据、无证据各看一遍取差,换来的却是把监督信号里的语言先验和 teacher 偏差大幅剔掉。

对做 VLM 训练的人,VAD 是个能直接替换 Vision-OPD 或 VA-OPD 的插件式目标函数,代价是单位数百分比的训练时间,收益是在细粒度视觉(看小字、数细节、高分辨率)上一档的提升。它尤其补上了 VA-OPD 漏掉的反驳能力:证据说 student 错了,就该把错答案压下去,而不是不痛不痒地不动。

要清醒的是,六项基准全是细粒度视觉,Gemini 3.1 Pro 这种通用旗舰在别的维度未必输,4B 反超它也只是 0.28 分的微弱优势。VAD 卖的是同源同预算下更准和小模型参数效率,不是通用能力的全面超越。

局限与存疑

作者自己认了两条。第一,每个位置只用一对反事实视角(有证据/无证据)算一个对比向量,可能对组合式证据有偏,用多视角或学一组方向基或许更准。第二,现在的投影做的是语义富集而不是可识别分离:提纯出的视觉成分里仍可能夹带 teacher 的非视觉影响,残差也还是混杂的,要更干净得靠带定位约束的分解。

读下来还有一处没被验证:六个基准全挤在细粒度视觉这一窄类,论文没给常规图文理解、长文档、视频上的表现,「不伤通用能力」这个隐含卖点只靠 MMVP 那组 +0.2 级别的数字撑着,说服力有限。另外训练集只有 6241 条合成数据,真实分布下的鲁棒性论文没展开。

术语

原文与代码

相关论文

全部论文解读