VCSD 去掉外部 teacher,Qwen3-VL 三个尺寸都涨分
UMCP · hf · 2026-07-24
这是什么
VCSD(Visual Contrastive Self-Distillation) 是一种面向视觉语言模型的 on-policy 自蒸馏方法,目标是去掉外部 teacher,以及答案、视觉证据等额外监督信号。
核心思路
- 在每个学生生成的前缀上,让 EMA teacher 在同一 prompt/prefix 下跑两次:
- 一次输入原始图像
- 一次输入内容擦除后的控制图像
- 通过两次输出的 token 级对数概率差,找出“由图像内容额外支持”的 token。
- 再用这个对比信号去锐化 teacher 在原图上的分布,并把这个更好的目标分布蒸馏给 student。
实验结果
在 ViRL39K 上,VCSD 在 Qwen3-VL 和 Qwen3.5 系列上都稳定优于对照 OPSD。
- Qwen3-VL 2B: 62.27% → 67.04%
- Qwen3-VL 4B: 71.30% → 73.16%
- Qwen3-VL 8B: 72.51% → 76.26%
价值
它只需要图像和问题,不需要额外推理时成本,也不依赖外部 teacher、答案、证据或 reasoning traces。
「多模态」频道最新
- Midjourney 把清晨场景做成了杂志感人像 — tisch_eins · 2026-07-24
- National Tequila Day 发起龙舌兰主题 AI 图像视频挑战 — LudovicCreator · 2026-07-24
- Reddit 用户让 Google AI 画出自己的工作地和人类版自我 — AddictionSorceress · 2026-07-24
- 游戏原生世界模型公布,配套 1.08 亿帧状态数据集 — Scobleizer · 2026-07-24
- 创作者用 FLUX.1 Dev 和 LTX-Video 2.3 做出 4 分钟动画短片 — developervkmp · 2026-07-24
- 像素空间评测显示,图像生成模型也会空间推理 — OmniAI-ZJU · 2026-07-24