VAD 让多模态蒸馏只学视觉证据,六项基准优于直接监督

Kangning Zhang · hf · 2026-08-04

这篇论文在做什么

论文研究的是 multimodal on-policy distillation(OPD):用一个“特权视角”的教师模型,去监督学生模型生成的轨迹。

核心方法:VAD

作者提出 Visual Attribution Distillation(VAD),目标不是简单把教师的纠正信号全塞给学生,而是先判断其中哪些纠正真的是视觉证据导致的:

实验结论

在 6 个细粒度视觉基准、4B 和 9B 两个规模上,VAD 都优于:

作者的 token 级和受控目标分析显示,VAD 提取出的对齐部分更富含任务相关的视觉纠正信息,尤其是在证据会反驳错误答案时,效果更明显。

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →