VCSD 去掉外部 teacher,Qwen3-VL 三个尺寸都涨分
UMCP · hf · 2026-07-24
这是什么
VCSD(Visual Contrastive Self-Distillation) 是一种面向视觉语言模型的 on-policy 自蒸馏方法,目标是去掉外部 teacher,以及答案、视觉证据等额外监督信号。
核心思路
- 在每个学生生成的前缀上,让 EMA teacher 在同一 prompt/prefix 下跑两次:
- 一次输入原始图像
- 一次输入内容擦除后的控制图像
- 通过两次输出的 token 级对数概率差,找出“由图像内容额外支持”的 token。
- 再用这个对比信号去锐化 teacher 在原图上的分布,并把这个更好的目标分布蒸馏给 student。
实验结果
在 ViRL39K 上,VCSD 在 Qwen3-VL 和 Qwen3.5 系列上都稳定优于对照 OPSD。
- Qwen3-VL 2B: 62.27% → 67.04%
- Qwen3-VL 4B: 71.30% → 73.16%
- Qwen3-VL 8B: 72.51% → 76.26%
价值
它只需要图像和问题,不需要额外推理时成本,也不依赖外部 teacher、答案、证据或 reasoning traces。
「多模态」频道最新
- Midjourney 风格参考分享:--sref 2912175708 — tisch_eins · 2026-09-11
- Astra 分镜+Minimax H3 分镜逐帧生成,视频创作成功率大增 — Hailuo_AI · 2026-09-11
- Hailuo 转推:MiniMax H3 MAX 一发生成 15 秒美食动画短片 — Hailuo_AI · 2026-09-11
- MiniMax Music 制作工具包 2.5 发布,新增完整母带处理链 — Vivid_Promise1700 · 2026-09-11
- ComfyUI 新节点发现器上线:按 star 增速过滤最新热门节点 — Luke2642 · 2026-09-11
- 用 MiniMax H3 MAX 对一只蚊子放大招,蚊子毫发无伤 — Hailuo_AI · 2026-09-11