教师自身偏差混进蒸馏信号,Cal-OPD丢掉近半后平均再涨2.3点

Calibrating Teacher--Student Discrepancy for On-Policy Distillation

Qiangqiang He, Jin Li, MingCai Chen

cs.AI

2026-09-18

标准OPD会把教师自身抖动一起学走。Cal-OPD用正负评价干预估出抖动区间,只留52%–65%蒸馏信号,两档Qwen3平均比标准OPD高2.3和3.1点。

这篇在解决什么

On-policy distillation(OPD)在学生自己采样的轨迹上,用教师对学生 token 的对数似然差当密集监督。它比离策略蒸馏少一层分布错配,也比只看最终对错的 RLVR 更密。标准做法默认:教师给这个 token 打的分,就是一份可靠参考。

这份参考并不稳。题目和学生轨迹都固定,只给教师加一点上下文,同一个 token 上的教师对数似然就会动。论文把这种现象叫 Teacher Self-Deviation(TSD,教师自身偏差)。在 Qwen3-8B 教师、Qwen3-1.7B 学生、DAPO 上约 6528 题、约 6000 万 token 的测量里,连「请仔细推理 / 请快点答」这种与题目无关的指令,都能让约 29.8% 的 token 出现显著 TSD。把正确答案或参考解再喂给教师,原先受影响的位置几乎全部保留(保留率 98.2%–98.6%),并且继续扩大到 39.6%。

更关键的是,TSD 对语义极性不敏感。把答案对错翻转后,方向一致率仍有 88.7%,共享偏差比 74.7%。显著 TSD 集中在 maybe、however、therefore、consider 这类话语标记上,出现时超过 89% 会抖;数字、根号、θ、frac 则低于 9.3%。学生如果把整段教师–学生差距都学走,学到的很大一块是教师的表面措辞过敏。

Privileged-OPD 把参考解直接塞进教师再蒸馏,等于把这份抖动一起放大。

方法

Cal-OPD 不把特权信息蒸馏给学生,只用它来量教师会抖多远。

对学生轨迹上的每个 token,额外给教师两次对比干预。默认用一对评价反馈:「金标准判定这段推理严谨正确」对上「判定这段推理不可靠」,不泄露题目解。两次干预相对无附加上下文的上偏和下偏,构成该 token 的经验抖动幅度;再乘松弛系数 λ=5,得到区间 [L, U]。学生对数似然落在区间内,优势函数置零;低于 L 只推到下界,高于 U 只压到上界。原始 OPD 差距因此被拆成「TSD 能解释的部分」和「校准后残差」,训练只优化后者。

直觉很直接:教师自己换个说法就会动的那截差距,别让学生去追。

训练用 verl,8 张 H20,师生各占 4 张;100 步、每步 256 条轨迹、学习率 1e-6。评测 Avg@16,温度 0.6。

结果

两档 Qwen3 思维模型,六个数学基准平均:

配置学生标准OPDPrivileged-OPDCal-OPD
4B-Thinking → 1.7B49.250.849.353.1
30B-A3B-Thinking → 4B66.665.964.069.0

相对学生分别 +3.9 和 +2.4,相对标准 OPD 分别 +2.3 和 +3.1。12 个「基准×配置」格子里拿下 7 个最好。ExOPD、EOPD、Uni-OPD 都停在 50.5–51.9 和 67.1–67.6。标准 OPD 在大档上把学生从 66.6 拉到 65.9;Privileged-OPD 两档都是蒸馏方法里最差。

训练动态:保留的 OPD 差距从约 65% 降到 52%,零优势 token 从 27% 升到 34%。标准 OPD 把平均回复从约 9.8K 拉到 11.8K,Cal-OPD 收在 9.3K。小档上每步 14.90 分钟,比标准 OPD 的 18.80 分钟还快,短回复抵消了多两次教师前向。大教师档则更慢:30B→4B 每步 48.76 对 31.26 分钟。

干预选择敏感。评价反馈最好(平均 53.1);解题级特权最差(49.0),只留约 20% 信号,学生熵升高、回复变短,属于过度过滤。λ=5 最优,再加大区间会把有用监督一并切掉。按保留比例匹配的衰减基线也追不上,说明增益来自「去掉哪一段」,不是单纯把梯度变小。

为什么重要

做 reasoning 后训练的人,OPD 现在是 RLVR 之外的常用捷径。这篇给出一个可操作的警告:教师–学生差距不是纯能力差,表面 token 上的教师抖动会被学生当知识学走,特权教师还会把这件事放大。校准的用法是「用特权信息量教师,不要用特权教师当老师」。

这是对 OPD 监督信号的一次清洗,不是新的蒸馏目标。现有变体改的是熵、探索或奖励外推,都没先问「这段差距该不该学」。小模型档上还能因为回复变短,把额外前向的成本吃回去。

局限与存疑

实验只覆盖数学推理和 Qwen3 家族两档规模,没有代码、代理或非思维模型。TSD 区间是有限次干预的近似,λ 和干预模板都是超参;解题级特权会把任务相关成分也滤掉,说明富上下文里「教师抖动」和「真知识」分不开。大教师档多出来的两次前向盖不住短回复省下的时间。论文没有单独的局限节,跨域、跨家族是否成立,只能算未验证。

术语

原文与代码

相关论文

全部论文解读