VCSD 用图像内容对比实现视觉语言模型自蒸馏
burny_tech · x · 2026-07-27
Visual Contrastive Self-Distillation(VCSD) 提出了一种更简单的视觉语言模型自蒸馏方法:不再依赖外部教师模型,也不需要 privileged answers,而是通过“原图 vs. 去内容控制图”的对比,把图像内容从教师信号里提炼出来。
方法
- 对每个学生生成的 response prefix,EMA teacher 会在同一个 prompt/prefix 下产出两组 next-token 分布:
- 一组条件在原始图像上
- 一组条件在去除内容的控制输入上
- 两者的 token 级 log-prob 差异,用来识别哪些 token 真正由视觉内容支撑。
- 研究者再用这个对比信号去“锐化”教师的原图分布,并把完整分布蒸馏给学生。
结果
- 在 ViRL39K 上评估。
- 相比匹配的 OPSD,VCSD 在 Qwen3-VL 和 Qwen3.5 上都取得更好结果。
- 以 Qwen3-VL 为例,七项基准综合分数从 62.27% → 67.04%(2B)、71.30% → 73.16%(4B)、72.51% → 76.26%(8B)。
- 不需要外部教师、额外标注、视觉证据信号、推理轨迹,也没有额外推理开销。
「研究」频道最新
- AI slop 已开始污染代码评审和科研署名体系 — rbhar90 · 2026-07-27
- ICML 2026 口头论文复现分数重算后仍偏中等 — profjamesevans · 2026-07-27
- 长周期智能体最终需要不可变事件日志 — sebpaquet · 2026-07-27
- Seed IQ 在 Doom II 里通关,引出 ARC-AGI 之后的评测问题 — Fit_Transition8824 · 2026-07-27
- 实测智能体数据科学工作流:代码能跑但常答错问题 — hugobowne · 2026-07-27
- 一份横跨 ML、系统、NLP 与音频的经典论文清单 — deliprao · 2026-07-27