剑桥对照实验拆解 on-policy 蒸馏优越感,遗忘与更新稀疏度由学习率主导

On-Policy or Off-Policy Learning? A Systematic Study of Distillation Dynamics

Julianna Piskorz, Antonin Berthon, Mihaela van der Schaar

cs.LG

2026-09-28

只用蒸馏测试台单独隔离 rollout policy:on-policy 在准确率、遗忘、稀疏度上无优势;KL 方向定成绩,学习率定遗忘,仅难任务泛化稳定受益。

这篇在解决什么

后训练圈流传一个说法:on-policy 数据更好,能减少灾难性遗忘、产生更稀疏的参数更新、改善泛化。但证据大多来自 SFT 与 RLVR 的对比,两者在目标函数、奖励信号、监督密度、优化流程、学习率上同时不同,rollout policy(生成训练轨迹用的是哪个模型)的效果从没被单独隔离过。成本差异却是实打实的:on-policy 要在训练中持续生成新轨迹,off-policy 可以反复用一批数据。剑桥团队为此搭了受控实验台:用强到弱蒸馏固定其余条件,只动 rollout policy。

方法

把 Llama-3.1-8B 蒸馏进 Llama-3.2-1B(对照组 Qwen2.5-7B→1.5B),任务覆盖医疗 MedReason、科学 Science、算术 Countdown,全参数微调 150 步,每个配置 3 个种子。损失是学生与教师在 rollout 轨迹上的逐 token KL。

核心操作是拆掉默认耦合:off-policy 蒸馏(OffPD)习惯配 forward KL,on-policy 蒸馏(OnPD)配 reverse KL,这个搭配只是序列级 KL 链式分解和单样本估计的副产品,并没有更优的保证。实验在全词表上算 KL,于是 rollout policy 与 KL 方向可以独立变化,再交叉 1e-5 / 5e-5 两档学习率(另补 1e-5 到 6e-5 扫描),三个因子构成完整网格。

梯度分析给出了不对称的来源。forward KL 对学生 logits 的梯度是 πS(v)−πT(v),每个分量都有 [−1,1] 的界,rollout 变化带来的梯度改变被两个轨迹分布的总变差距离线性上界。reverse KL 的梯度则由 πS(v) 乘一个无界 log 比值:学生给教师眼中几乎不可能的 token 分了概率,梯度会爆;学生漏掉教师的某个模式,又没有梯度把它捞回来。所以 reverse KL 依赖在学生自己的前缀分布上训练。实验还设计了连续的 rollout 谱 πλ:λ=−1 即 OffPD,λ=+1 即 OnPD,|λ|>1 朝某一侧偏好的 token 外推。

结果

对比指标结果
OnPD vs OffPD三任务最佳平均 ID 准确率72% vs 73%
forward vs reverse KLID 准确率波动区间71–73% vs 35–72%
学习率 1e-5 vs 5e-5OOD 平均变化±1.3 个百分点内 vs −11.2−14.0 个百分点
学习率 1e-5 vs 5e-5更新稀疏度(τ=10⁻⁶)85.3–89.6% vs 51.9–60.0%
λ>0 vs off-policyCountdown-4E pass@k稳定高 10–15 个百分点

rollout policy 本身几乎测不出差别。KL 方向决定任务成绩:forward KL 在所有 rollout policy 和学习率下稳在 71–73%,reverse KL 在 35–72% 之间摆动,对学习率高度敏感。学习率决定遗忘和稀疏度:更新稀疏度随学习率上升近似线性下降(R²=0.94 / 1.00),OOD 一路走低;同学习率下 OffPD 在几乎所有对比里遗忘更少,更新稀疏度在任何配对里都不低于 OnPD,「on-policy 带来更稀疏更新」的说法在这里不成立。

谱实验与梯度分析对上了:forward KL 全谱准确率保持在 80% 以上,1e-5 学习率下只波动 5.2 个百分点;reverse KL 大起大落,只在学生偏好的 rollout 上表现好,高学习率下偶发崩溃。

on-policy 的好处真实但局部。在更难的 Countdown-4E 变体上,越 on-policy 的 rollout 比 off-policy 高出 10–15 个百分点的 pass@k,两种 KL 方向下都成立;但接上 RLVR 后这个优势不再可靠:reverse-KL 检查点先快速上涨随后奖励崩溃,持续到最终且奖励最高的是 off-policy 检查点(低学习率配 forward KL,或高学习率配 reverse KL),尽管它们起点接近 0%。一个附带发现:让教师用西班牙语推理,只有 OnPD 加 reverse KL 保住了学生的英文回答风格,其余配置几乎全程西语化。

稳健性过了三关:换成采样 KL、去掉梯度裁剪(此时 reverse KL 成绩大幅下滑,forward KL 在大学习率下仍撑住)、换到平均响应 622 token 的 Numina–MATH,主结论都成立。长推理数据集上 OnPD 加 reverse KL 拿到 59.0% 的最佳成绩(基线 53.1%),但该组每个条件只跑了一次,作者自己标注为「有提示性」。

为什么重要

最直接的建议:on-policy 蒸馏研究今后应把 OffPD 列为标准基线,它训练中不需要实时生成,省下的是真算力。食谱层面:要保旧能力,forward KL 配小学习率能拿到顶级成绩并把遗忘压在 1.3 个百分点内;要输出多样,forward KL 在相近 pass@1 下 pass@10 明显高于 reverse KL;要避免学生沾染教师风格,OnPD 加 reverse KL 是唯一做到的组合。此前归给「on-policy」的东西,大头是 KL 方向和学习率在起作用。

局限与存疑

作者自述边界:学生不超过 1.5B,推理轨迹不超过 2000 token,教师全程固定,只试了同家族师生对。150 步的训练量偏短,长日程未验证。MATH 实验的最优检查点选择与汇报用的是同一批评测,作者承认数字可能偏乐观。RLVR 之后的奖励崩溃只给了现象没给机制,300 步的窗口也不长。受控设定同时也是结论的边界:它隔离的是蒸馏里的 rollout policy,SFT 与 RLVR 之争还涉及奖励信号和监督密度,这篇没有触及。

术语

原文与代码

相关论文

全部论文解读