Self-Supervised Visual On-Policy Distillation
Yijiang Li, Yijun Liang, Yunjie Tian, Bingyang Wang, Ke Zhang, Zhenfei Yin, Di Fu, Philip Torr, Nuno Vasconcelos
cs.CV, cs.AI
2026-08-14
S²VOPD 靠给学生看降质图片制造师生落差,把 Qwen3.5-4B 六项细粒度感知基准均分从 70.7% 提到 77.4%,超过 Qwen3-VL-235B。
视觉领域的 on-policy distillation(OPD)靠老师比学生「多知道点什么」来产生有用的监督信号:要么老师模型更大更强,要么老师能看到标准答案、感兴趣区域这类特权信息。可现实中大多数场景两者都没有:没有更强的老师模型,也没有人工标注的特权信息。这篇论文问的是一个很直接的问题:什么都没有的时候,这个「师生落差」还能从哪儿来。
答案是反过来做:不给老师加信息,给学生减信息。论文用同一个模型的 EMA(指数移动平均)版本当老师,老师看原图,学生看同一张图的强增强(降质)版本,两者走同一个问题、生成同样的 rollout 轨迹,然后用广义 Jensen-Shannon 散度把老师在原图上的 token 分布蒸馏给学生。学生自己「看不清」制造出的信息差,效果上等价于一个信息更充分的外部老师,但不需要标注、不需要奖励、也不需要另训一个更强模型。
论文系统搜索了四类增强方式,信息缩减(降分辨率、加噪声)、几何(旋转、裁剪)、光度(亮度/对比度/饱和度)、遮挡(随机擦除、GridMask),得出三条结论:第一,不对称本身有用,四类增强都能提升效果,而对称的自蒸馏(师生看同一张图)反而会拉低性能;第二,强度要适中,性能随师生分布落差先升后降,过犹不及;第三,落差必须保留任务相关证据,裁剪虽然能制造很大的落差,但一旦把答案所需的视觉证据裁掉,这个落差就是噪声而非信号。最终最优配方是「降分辨率(0.30.6 倍)+ 加性高斯噪声」的组合。
| 配置 | V | HR-8K | MME-RW | 六项均分 |
| Qwen3.5-4B 基座 | 84.29 | 63.86 | 63.86 | 70.68 |
| S²VOPD(4B) | 87.43 | 83.62 | 72.87 | 77.44 |
| Qwen3-VL-Instruct-235B | 91.10 | 85.50 | 74.82 | 75.75 |
| GPT-5.4 | 76.96 | 84.00 | 71.87 | 72.78 |
S²VOPD 把 4B 模型的六项细粒度感知基准均分从 70.68% 提到 77.44%,超过参数量大 59 倍的 Qwen3-VL-235B(75.75%),也超过 GPT-5.4(72.78%)。在同样的 Vision-OPD-6K 训练数据下,对比需要 GT 区域标注的 ZwZ、需要标准答案的 OPSD 等有特权信息的方法,S²VOPD 不用任何特权信息就拿到最好的综合成绩,而且没有牺牲数学推理。相比之下,ZwZ 会让 MathVerse 掉 27.1 个百分点,OPSD 会让 MathVision 掉 9.3 个百分点。消融显示,去掉学生视图增强(只留老师-学生同图)直接把增益打回基座水平(70.52%),说明增益几乎全部来自这个人为制造的不对称,而不是 EMA 老师本身的自我提升(冻结 EMA 老师只掉 0.4 个百分点)。
对做视觉语言模型后训练的团队,这提供了一条不依赖大模型蒸馏、不依赖人工标注就能提升小模型细粒度感知能力的路径,尤其适合没有更强教师模型可用的场景。核心可迁移的洞察不是「降分辨率加噪声」这个具体配方,而是「往学生一侧做减法、用增强强度控制师生分布散度」这个设计原则。论文给出了强度与效果的关系曲线(JS 散度约 0.014 附近是甜蜜点),这本身就是调参时可以复用的诊断工具。
论文自己承认裁剪类增强会破坏空间相关问题的答案,说明这套方法对增强算子的选择很敏感,换一批任务(比如空间推理而非细粒度识别)最优增强族可能完全不同。论文的评测集中在感知类基准和三个数学推理基准,没有测试更依赖长程规划或多轮交互的任务,增强驱动的自监督信号能否在这些场景下依然有效并不清楚。另外,方法本质上要求老师能看到「更清晰」的同一份输入才能产生信息差,如果某类任务本身没有可操作的「降质」维度(比如纯文本推理),这套思路能否直接套用也是开放问题。