VAD 让多模态蒸馏只学视觉证据,六项基准优于直接监督
Kangning Zhang · hf · 2026-08-04
这篇论文在做什么
论文研究的是 multimodal on-policy distillation(OPD):用一个“特权视角”的教师模型,去监督学生模型生成的轨迹。
核心方法:VAD
作者提出 Visual Attribution Distillation(VAD),目标不是简单把教师的纠正信号全塞给学生,而是先判断其中哪些纠正真的是视觉证据导致的:
- 分别在有证据和去掉证据的情况下评估同一个固定教师。
- 两种情况下中心化 log-probability 的变化,被当作一个表示视觉证据方向的符号代理。
- 将原始纠正投影到这个代理上,拆成与干预对齐的部分和无法由代理解释的残差。
- 训练时主要使用重建出的、以学生为锚点的目标;特权教师只作为弱正则项。
实验结论
在 6 个细粒度视觉基准、4B 和 9B 两个规模上,VAD 都优于:
- 直接的特权视角蒸馏
- visual-advantage weighting
作者的 token 级和受控目标分析显示,VAD 提取出的对齐部分更富含任务相关的视觉纠正信息,尤其是在证据会反驳错误答案时,效果更明显。
「多模态」频道最新
- AI 视频广告突破:Seedance 2.5 完美还原美妆试用,外观动作零翻车 — FinanceYF5 · 2026-08-04
- MiniMax H3 的 ComfyUI 实测:高分辨率和高步数更稳 — ayakitodev · 2026-08-04
- 一条名为“kurt cobain, tupac, take money 1080”的离谱 AI 视频 — TMcFly · 2026-08-04
- ComfyUI 上线实验性 Sol-Attn Triton,实现已测 4090 和 5090 — bdsqlsz · 2026-08-04
- 用户称 MiniMax H3 在 1344×768 下仍显像素感 — PhilMcGraw · 2026-08-04
- 一个 Stable Diffusion LoRA 不断产出离谱海报 — CryptoChangeling69 · 2026-08-04