SAF-OPD: Stable Advantage Fusion for On-Policy Distillation
Yifan Ding, Xincheng Wei, Yoshua Y. Li, Ziheng Li, Yuquan Lu, Siyu Zhang, Dongsheng Ma, Rongxiang Weng, Xunliang Cai, Yun Chen
cs.LG, cs.AI
2026-07-31
融合 GRPO 和策略蒸馏时固定权重会把策略熵压塌,SAF 用四段控制稳住训练,六个模型-领域设置全面领先 0.51–2.70%。
RLVR(带可验证奖励的强化学习)像 GRPO,把一整条回答对不对变成一个奖励,平均摊给每个 token,信号稀疏但能跳出老师设定的天花板。on-policy distillation(OPD,在线策略蒸馏)反过来,拿一个更强的老师给每个 token 打分,信号密集但上限锁死在老师水平,还会压制探索。两条路互补,把两个优势加在一起是很自然的想法。直接用一个固定系数把它们相加却会引发熵塌缩(entropy collapse),模型早早变得过分确定,后面再也学不动。这篇把这种塌缩拆成两个能具体定位的错配。
SAF(Stable Advantage Fusion)只动 OPD 那一支,RLVR 信号原样不动,在相加前给 OPD 优势过四道关:
这两道管「幅度错配」。作者实测 OPD 优势的极端值能到 20.36,而同序列最大的 GRPO 优势只有 2.47,抽样的 180 个最大 OPD token 个个都盖过 GRPO;固定相加时 OPD 的尖峰直接把 GRPO 信号冲掉,压进 ±0.1 之后两者量级才对得上。
这两道管「时间错配」。固定融合全程满血 OPD,一直把学生往老师身上拽,恰恰抹掉了 RLVR 该提供的、能超越老师的探索;退火让 OPD 只在早期帮忙、晚期让位。四道关每道都能单独开关,额外开销可忽略。
7 个基准:数学(AIME-24、AIME-25、HMMT25 二月与十一月)、代码(HumanEval+、MBPP+、LiveCodeBench)。学生用 Qwen3-1.7B/4B/8B,老师用 Qwen3-30B-A3B-Instruct-2507。对照是基座、单 GRPO、单 OPD、固定系数 GRPO+OPD。
| 设置 | 相对固定融合的提升 |
| Qwen3-8B | 数学 +0.97%,代码 +1.67% |
| Qwen3-4B | 数学 +1.51%,代码 +2.70% |
| Qwen3-1.7B | 数学 +1.85%,代码 +0.51% |
六项模型-领域设置全部正向,0.51–2.70%,六项平均聚合分到 49.46%。训练曲线上,固定融合把策略熵从约 0.35 一路压到 0.30 就不动,SAF 把熵维持在 0.35–0.38;而 KL 掉得最低(贴老师最紧)的那档设置恰恰准确率最差,从反面印证了「贴老师贴太紧」会害事。Qwen3-4B 上 SAF 在 7 个基准里拿下 6 个最优。作者也老实交代例外:MBPP+ 上 SAF 落后单 GRPO 和单 OPD 不超过 0.53 个点,但平均仍赢过固定融合。
OPD 与 RLVR 混用是工业界调小模型很常见的组合,多数人就是拍一个固定权重,然后发现训练不稳、模型变「死」。这篇的价值在于把「为什么不稳」讲成两个可操作的机制(幅度、时间),给了一套每段都能开关、开销可忽略的修法。增益是单位数百分点,属渐进改进,不是范式跳变;作为一个能叠在现有 GRPO+蒸馏流水线上的稳定器,性价比很高,适合拿到自己场景上试。
作者明确不声称结论在 1.7B–8B 之外、换了老师或换了超参后仍然成立,尺度增益与领域是耦合的(代码增益随尺度上升,数学反之),没有一个单调的「越大越赚」。只测了 GRPO 一种 RLVR 实例,换 PPO 或 RLOO 会怎样没碰。代码部分提升最小的恰恰是最小的 1.7B(只 +0.51%),小模型上这套控制是否还值得加得自己验证。权重更新几何那套分析(稳定秩、子空间重叠)作者只用来观察现象,没有回译成能指导设计的结论,留作未来工作。