VCSD 去掉外部 teacher,Qwen3-VL 三个尺寸都涨分

UMCP · hf · 2026-07-24

这是什么

VCSD(Visual Contrastive Self-Distillation) 是一种面向视觉语言模型的 on-policy 自蒸馏方法,目标是去掉外部 teacher,以及答案、视觉证据等额外监督信号。

核心思路

实验结果

在 ViRL39K 上,VCSD 在 Qwen3-VL 和 Qwen3.5 系列上都稳定优于对照 OPSD。

价值

它只需要图像和问题,不需要额外推理时成本,也不依赖外部 teacher、答案、证据或 reasoning traces。

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →