OPD² 只蒸馏推理训练的「差」,思维链模式下修好了 OPD 的帮倒忙

On-Policy Delta Distillation

Byeongho Heo, Jaehui Hwang, Sangdoo Yun, Dongyoon Han

cs.LG, cs.CL

2026-07-17

OPD² 把蒸馏 reward 换成 teacher 相对 base 的 delta,Qwen3-4B 数学 45.8→70.3;思维链下传统 OPD 掉、OPD² 仍涨。

这篇在解决什么

强化学习里学推理,奖励模型是瓶颈。on-policy 蒸馏绕开它:让 student 自己采样,每个 token 由 teacher 给对数概率当监督。这套 reward 长这样:R = log πteacher(yt) − log πstudent(yt),看着自然,但 NAVER 这篇指出它的设计一直没人细究。问题在于它蒸馏的是「整个 reasoning-tuned 的 teacher」,连 teacher 在推理训练之前就有的风格偏好也一起搬过来,而这些未必是推理能力本身。

方法

OPD² 换了个信号。delta 信号定义为 teacher 和它指令微调前的 base 模型之差:RΔ = log π(yt) − log πbase(yt)。直觉是:teacher 相对 base 多出来的那部分,才真正是推理训练「学到的」东西,把它单独拎出来当 reward,比照搬整个 teacher 更直接。

词云给了一个佐证:delta 放大了 hence、however、thus 这类推理连接词,压低了 see、try、verify、perhaps 这类 base 模型自带的探索腔。它在挑「推理痕迹」,不是挑「teacher 的口吻」。

换个角度理解:base 模型本身已经会下一 token 预测和通用的语言能力,推理训练给它新加的是分步推演、自我检查这一类增量。delta 信号只奖励这部分增量,避免 student 把力气花在模仿 teacher 的遣词造句上。

光用 delta 会不稳:它不考虑 student 本身,delta-only 训练会塌成只追最大 reward 的 one-hot。OPD² 因此加了两个保护:中心化和「与原 OPD 方向同号」的联合条件,只在 delta 和原 OPD 指向一致时才用 delta。消融显示,去掉 delta 信号掉得最狠(non-thinking 数学 −4.1,thinking −5.3),说明 delta 是收益的主因。

结果

跨数学(AIME/AMC/MATH500 等)、科学(GPQA/SuperGPQA/SciBench)、代码(CodeContests/CodeForces/LiveCodeBench),OPD² 一致超 OPD 和 ExOPD。Qwen3-4B 非思维链数学:Base 45.8 → OPD 64.0 → OPD² 70.3;代码:22.1 → 31.4 → 40.1。

最值得记的一组数字在思维链模式下:

Qwen3-4B(thinking 数学)分数
Base73.3
+OPD70.9(掉)
+OPD²74.8

传统 OPD 在思维链下反而把模型训差,OPD² 是唯一继续涨的,1.7B 到 8B 三个尺寸都是这个规律。这是论文最反直觉的一条:思维链模型本来就会拆解推理,这时再强行对齐 teacher 的整条输出分布,反而干扰它已有的推理路径;只补增量的 delta 才不撞车。跨家族搬到 Gemma4-E4B 上,数学从 60.6 涨到 67.8,但代码没回到 base 的 55.2,说明跨家族迁移有损耗。

为什么重要

蒸馏是把大 teacher 的推理能力搬到小模型的主流手段,这篇给了一个便宜又有效的 reward 改造:只在推理训练前后 teacher 的「差」上下功夫。对做小模型推理的团队,它是几乎免费的提升;更关键的是它点破了「照搬 teacher」在思维链模式下可能帮倒忙。

局限与存疑

成本要算一笔:多一次 teacher-base 前向,Qwen3 训练时间涨 24%–28%(Gemma4 约 8%)。跨家族时 OPD² 比 OPD/ExOPD 保得住能力,但 Gemma4 代码仍没超回 base,迁移不是无条件成功。delta-only 不稳、必须配中心化和同号条件,这套调度对超参是否鲁棒,论文只在有限设置里验证过。

术语

原文与代码

社区讨论

相关论文

全部论文解读