I-SDPO: Instance-Level Adaptive Self-Distillation Policy Optimization
Yubo Zhang, Xinhong Ma, Zezhong Tan, Ziqiang Dong
cs.LG, cs.CL
2026-08-13
把「教师蒸馏」只分配给全错 rollout 组、混合组留给 GRPO,Qwen3-8B 上 SciKnowEval 平均准确率从 56.67% 提到 70.31%。
GRPO 是目前 LLM 推理训练的主流 RL 算法:同一个 prompt 采一组回答,组内互相减出优势,不需要单独的 critic。它的死穴在「全错组」。一道难题,16 个采样全都不对,组内奖励几乎相同,优势全部塌到零,梯度消失。论文算了笔账:单样本成功率 10%、K=16 时,全错组占比约 18.5%;成功率降到 0.01 这类极难样本,几乎每个组都是全错。能力越弱、题目越难,信号越少,恰是最需要学习的地方。
已有的一条补法是 privileged self-distillation(特权自蒸馏):教师看着标准答案,给学生生成的轨迹逐 token 打软标签。信号密、方差低,但教师本身有偏:它是学生的 EMA 副本,共享学生的系统性错误;它锚定在特定解法风格上,而奖励可能接受多种正确路径。全程蒸馏等于用一个有偏目标替换奖励目标,策略变强之后,这个偏差会反过来拖累奖励提升。
矛盾在于:蒸馏信号早期有用、后期有害,而「早晚期」不是时间轴上的全局刻度,是逐题变化的。简单题可能第一步就有成功采样,难题可能训练结束仍全错。
I-SDPO 的核心是把「信不信教师」交给每组 rollout 自己投票,一次路由,整组共享:
教师不是外部模型,是学生的 EMA 副本(更新率 0.05,平均滞后约 19 步)。它的特权在于输入:标准答案直接拼在 prompt 后面,再对学生生成的 token 逐位置打分布。蒸馏损失用前向 KL 与反向 KL 各半插值(α=0.5),并在 token 级做熵加权:教师分布熵低(自信)的位置权重大,熵高的位置降权。作者明确说这只是置信度代理,救不了「自信地错」的教师。
两个理论结果支撑设计。命题一:教师目标与奖励最优解差一个偏差 b 时,蒸馏权重 λ 不退场,参数就停在离最优 λ/(1+λ)·b 的位置,多余奖励损失约 ½[λ/(1+λ)]²‖b‖²。固定蒸馏有一个偏差地板。命题二:单样本成功率 pt 不降、K 次条件独立采样时,全错组概率 (1−pt)^K 单调不增。路由规则天然把有效 λ 随能力增长压向零,教师自动退场,不需要手工设计的衰减日程。
这个自退火是按题区分的:同一训练步,简单题早已回到 GRPO,难题还在蒸馏。对照的 sample-level 路由(SRPO)把组内每个错样本单独送蒸馏,等于拆掉了混合组的对照结构:15 错 1 对的组,SRPO 把 15 条负证据换成了模仿目标。
SciKnowEval 四个科学领域,Qwen3-8B,训练 2 个 epoch,指标是 mean@16 准确率:
| 方法 | Biology | Material | Chemistry | Physics | 平均 |
| GRPO | 32.12 | 70.74 | 62.92 | 60.88 | 56.67 |
| SDPO(纯蒸馏) | 45.93 | 71.41 | 76.64 | 68.98 | 65.74 |
| SRPO(样本级路由) | 44.27 | 72.94 | 78.69 | 68.12 | 66.01 |
| I-SDPO | 50.25 | 74.53 | 81.16 | 75.31 | 70.31 |
训练动态与自退火预测一致:生物域 GRPO 路由占比从 step 50 的约 0.65 升到 step 350 的约 0.90,全错组占比从 0.22 降到 0.03。消融上,α=0.5 的双向 KL 混合在四个域全部最优,跨域平均 68.16%,高于纯前向 KL 的 60.39% 和纯反向 KL 的 61.63%。
全错组不是冷启动阶段的专利。换一个更难的 benchmark、更小的基座模型、更严的奖励判定,全错组占比立刻上来,GRPO 在这些设定下就是在空转。I-SDPO 给的是一个几乎零额外超参的补位方案:路由判据是「组内有没有一个对的」,二值、可观测、不用估计梯度对齐度;教师是现成的 EMA 副本,不增加推理侧部署。它把手工蒸馏日程换成了 (1−p)^K 这条按题自适应的曲线。
对做 RL post-training 的人,这是「蒸馏和 RL 各管一段」这个直觉的一次机制化:不是按训练步数切换,是按每题的能力证据切换。SRPO 对照说明粒度不能省,混合组的负样本是有价值的,不该拿去模仿。
也要说清它改进的量级位置:纯蒸馏就能拿到 13 个点里的 9 个,I-SDPO 的贡献是把这 9 个点扩到 13.6,同时避免全程蒸馏的后期拖累。核心创新在调度,不在蒸馏本身。
作者自己列了两条:只有 Qwen3-8B 一个规模,且只在 SciKnowEval 上评测。更深的基座全错组更少,补位收益会缩水;数学或开放推理任务的奖励结构与解法多样性不同,结论未必平移。
读下来另有几处存疑: