老师 confident 的 token 也可能错:一次去 prompt 前向,蒸馏涨 3.5 分

When Teachers Mislead: Spurious-Signal-Aware On-Policy Distillation

Yinuo Jiang, Yongjie Ye, Zhou Tao, Xiang Zhuang, Qiang Zhang, Huajun Chen, Tiankai Li

cs.AI

2026-08-04

on-policy 蒸馏里,老师的 token 判断可能由模板先验驱动而非输入驱动;SA-OPD 多跑一次去掉 prompt 的前向,把「信号几乎不变」的高梯度 token 当虚假信号滤掉,VLM 视觉理解均分 +3.5。

这篇在解决什么

On-policy 蒸馏(OPD)让学生在自己采样的轨迹上跑,老师在每个 token 上给密集的监督信号,比稀疏的序列级奖励更高效。最近的选择性 OPD 更进一步,挑那些 confident、informative 或 learnable 的 token 来重点学。

但这套做法有个没被注意的盲区:老师在每个 token 上的判断,可能根本不由当前输入驱动,靠的是语言先验、格式套路、刻板推理模板。作者把这类「优化相关、却跟输入弱相关」的监督叫 spurious signal(虚假信号)。它能产生很大的梯度,却几乎不给任务方向,属于纯粹的干扰梯度,还会推着参数乱漂。

方法

SA-OPD 的核心是一个 input-groundedness proxy(输入接地代理):判断一个 token 的蒸馏信号到底是不是真依赖输入。

理想度量是输入和该 token 蒸馏信号的条件互信息,但没有闭式解。作者的近似做法很直接:对每个 token 多算一次老师-学生的散度,这次把 prompt 去掉、只保留学生生成的前缀。如果信号真依赖输入,去掉 prompt 后它应该明显变;如果几乎不变,说明这个判断是模板顶上去的,换个输入它也这么说。两次的差 ∆IGt 就是输入接地程度,差越小越虚假。

光看接地还不够。作者把虚假信号定义为两个条件同时成立:∆IGt 低(信号不依赖输入)且 |At| 大(优化冲击大)。单看散度会把有用的、接地的高散度 token 也滤掉;单看接地会误伤大量低冲击的噪声 token。两个轴取交集,只打那些「大梯度却不接地」的最有害部分。

滤除比例受一个动态约束兜底,防止一次删掉太多梯度质量。

结果

主实验在 Qwen3-4B-Instruct → Qwen3-1.7B(LLM)和 Qwen3.5-35B-A3B → Qwen3.5-2B(VLM)上做。

VLM 视觉理解平均分从 Vanilla OPD 的 50.5 提到 SA-OPD 的 54.0(+3.5),视觉推理从 60.4 提到 63.5(+3.1),六个子任务全部最优。单任务增益最大的是 CountQA,从 26.4 涨到 33.6(+7.2)。

设置视觉理解视觉推理
Vanilla OPD50.560.4
TIP(最强对手)52.361.6
SA-OPD54.063.5

LLM 数学推理增益相对温和,平均从 28.5 提到 30.4(+1.9),其中 Math500 从 66.4 提到 69.6。作者的解释是:VLM 任务里虚假信号是持续的结构性污染,过滤收益大;LLM 数学上虚假信号更像短暂的优化噪声,收益小一些。

消融验证了「两轴都得要」。单滤散度 69.8,单滤接地 69.0,SA-OPD 72.2(Geo3K)。开销可控:相比 Vanilla OPD 单步多 2.64%–7.53% 的墙钟时间,不引入额外可训练参数,只是多一次老师和学生在前缀上的前向。

为什么重要

对做蒸馏的人,结论可操作:老师的 confident 不等于对输入有依据。加一次去 prompt 的前向、滤掉信号不变的 token,是个轻量、即插即用的改动,在 VLM 这种监督最脏的场景里收益最大。它也说明,蒸馏的信号选择除了看「学不学得动」,还该多看一个维度:这个判断到底是不是冲着当前输入来的。

局限与存疑

论文没有专门的「局限」小节,散落的边界得自己挑。代理只是近似:它度量的是「去 prompt 后信号稳不稳」,不是真正的互信息。固定的选择比例跨任务可能脆弱,作者靠动态约束缓解,但那个约束的 β 也只在线索任务上认真调过。增益对 β 敏感,CountQA 分数随 β 在约 3 分的区间里摆动。LLM 只在数学推理上测了,没碰代码、开放生成、agent、多语言。滤掉的 token 里六成多是实义词,说明每步都在丢一部分有用信号,这是设计代价。换非 Qwen 家族、老师与学生不同家族、RLHF 场景,都没测。

术语

原文与代码

相关论文

全部论文解读