GRPO 全错组梯度归零,阿里 I-SDPO 按题路由蒸馏把科学问答拉高 13.6 分

I-SDPO: Instance-Level Adaptive Self-Distillation Policy Optimization

Yubo Zhang, Xinhong Ma, Zezhong Tan, Ziqiang Dong

cs.LG, cs.CL

2026-08-13

把「教师蒸馏」只分配给全错 rollout 组、混合组留给 GRPO,Qwen3-8B 上 SciKnowEval 平均准确率从 56.67% 提到 70.31%。

这篇在解决什么

GRPO 是目前 LLM 推理训练的主流 RL 算法:同一个 prompt 采一组回答,组内互相减出优势,不需要单独的 critic。它的死穴在「全错组」。一道难题,16 个采样全都不对,组内奖励几乎相同,优势全部塌到零,梯度消失。论文算了笔账:单样本成功率 10%、K=16 时,全错组占比约 18.5%;成功率降到 0.01 这类极难样本,几乎每个组都是全错。能力越弱、题目越难,信号越少,恰是最需要学习的地方。

已有的一条补法是 privileged self-distillation(特权自蒸馏):教师看着标准答案,给学生生成的轨迹逐 token 打软标签。信号密、方差低,但教师本身有偏:它是学生的 EMA 副本,共享学生的系统性错误;它锚定在特定解法风格上,而奖励可能接受多种正确路径。全程蒸馏等于用一个有偏目标替换奖励目标,策略变强之后,这个偏差会反过来拖累奖励提升。

矛盾在于:蒸馏信号早期有用、后期有害,而「早晚期」不是时间轴上的全局刻度,是逐题变化的。简单题可能第一步就有成功采样,难题可能训练结束仍全错。

方法

I-SDPO 的核心是把「信不信教师」交给每组 rollout 自己投票,一次路由,整组共享:

教师不是外部模型,是学生的 EMA 副本(更新率 0.05,平均滞后约 19 步)。它的特权在于输入:标准答案直接拼在 prompt 后面,再对学生生成的 token 逐位置打分布。蒸馏损失用前向 KL 与反向 KL 各半插值(α=0.5),并在 token 级做熵加权:教师分布熵低(自信)的位置权重大,熵高的位置降权。作者明确说这只是置信度代理,救不了「自信地错」的教师。

两个理论结果支撑设计。命题一:教师目标与奖励最优解差一个偏差 b 时,蒸馏权重 λ 不退场,参数就停在离最优 λ/(1+λ)·b 的位置,多余奖励损失约 ½[λ/(1+λ)]²‖b‖²。固定蒸馏有一个偏差地板。命题二:单样本成功率 pt 不降、K 次条件独立采样时,全错组概率 (1−pt)^K 单调不增。路由规则天然把有效 λ 随能力增长压向零,教师自动退场,不需要手工设计的衰减日程。

这个自退火是按题区分的:同一训练步,简单题早已回到 GRPO,难题还在蒸馏。对照的 sample-level 路由(SRPO)把组内每个错样本单独送蒸馏,等于拆掉了混合组的对照结构:15 错 1 对的组,SRPO 把 15 条负证据换成了模仿目标。

结果

SciKnowEval 四个科学领域,Qwen3-8B,训练 2 个 epoch,指标是 mean@16 准确率:

方法BiologyMaterialChemistryPhysics平均
GRPO32.1270.7462.9260.8856.67
SDPO(纯蒸馏)45.9371.4176.6468.9865.74
SRPO(样本级路由)44.2772.9478.6968.1266.01
I-SDPO50.2574.5381.1675.3170.31

训练动态与自退火预测一致:生物域 GRPO 路由占比从 step 50 的约 0.65 升到 step 350 的约 0.90,全错组占比从 0.22 降到 0.03。消融上,α=0.5 的双向 KL 混合在四个域全部最优,跨域平均 68.16%,高于纯前向 KL 的 60.39% 和纯反向 KL 的 61.63%。

为什么重要

全错组不是冷启动阶段的专利。换一个更难的 benchmark、更小的基座模型、更严的奖励判定,全错组占比立刻上来,GRPO 在这些设定下就是在空转。I-SDPO 给的是一个几乎零额外超参的补位方案:路由判据是「组内有没有一个对的」,二值、可观测、不用估计梯度对齐度;教师是现成的 EMA 副本,不增加推理侧部署。它把手工蒸馏日程换成了 (1−p)^K 这条按题自适应的曲线。

对做 RL post-training 的人,这是「蒸馏和 RL 各管一段」这个直觉的一次机制化:不是按训练步数切换,是按每题的能力证据切换。SRPO 对照说明粒度不能省,混合组的负样本是有价值的,不该拿去模仿。

也要说清它改进的量级位置:纯蒸馏就能拿到 13 个点里的 9 个,I-SDPO 的贡献是把这 9 个点扩到 13.6,同时避免全程蒸馏的后期拖累。核心创新在调度,不在蒸馏本身。

局限与存疑

作者自己列了两条:只有 Qwen3-8B 一个规模,且只在 SciKnowEval 上评测。更深的基座全错组更少,补位收益会缩水;数学或开放推理任务的奖励结构与解法多样性不同,结论未必平移。

读下来另有几处存疑:

术语

原文与代码

社区讨论

相关论文

全部论文解读