Salesforce 用自身 RL 轨迹外推当教师,OLMo-7B 数学 AIME24 从 30.2 升到 46.9

RISE: Recursive Improvement via Self-Extrapolating Policy Distillation

Yang Li, Semih Yavuz, Shafiq Joty

cs.AI

2026-09-04

RISE 把当前 checkpoint 相对滞后锚点的位移在 logit 或权重空间外推成教师,再蒸馏回学生。OLMo-7B 数学均分从 GRPO 的 47.6 升到 56.4,不增加采样。

这篇在解决什么

RLVR 只给整段一个对错,每个 token 分到同一优势,分不清哪一步在帮倒忙。On-policy distillation 能在每个位置给完整下一 token 分布,教师从哪来却是瓶颈:外部强模型会在学生走出分布后胡猜续写;把正确答案塞进上下文的自蒸馏,又受 in-context 能力限制。已有补丁多半在给坏教师做门控或混合,没有问教师该是谁。

RISE 的答案是:教师是沿训练轨迹外推出来的「未来自己」。

方法

一轮先做 RLVR,从 θn 更新到 θ'n+1。位移 θ'n+1 − θanchor 给出改进方向。用 β>1 外推得到 πfuture,再把学生往这个教师的 token 分布上推,得到 θn+1。β=1 时教师就是当前 checkpoint,没有蒸馏信号。

两条实例化。权重空间:θfuture = θanchor + β(θ'n+1 − θanchor),就是外推版 task arithmetic,OPD 时对这组参数做前向。Logit 空间:对下一 token log 概率做同样外推,等价于几何混合 πanchor^(1−β) · π'^(β),是权重外推的一阶近似。实践里对教师 top-100 再加一个尾桶做 JSD,避免反向 KL 炸掉。

β 从 1.2 线性降到 1,靠近最优时外推过头会翻车。锚点对 Qwen 用 EMA(η=0.1),对 OLMo 用上一 checkpoint。RLVR 的 rollout 原样拿来蒸馏,不额外采样,墙钟大约是 GRPO 的 1.3 到 1.6 倍。

结果

数学上两条实例化都压过 GRPO 和带特权上下文的自蒸馏。

设置GRPO 数学均分RISE 最好AIME24
Qwen3-8B60.062.7(权重)54.4 → 58.1
Qwen3-1.7B45.450.2(logit)30.0 → 36.3
OLMo3-7B47.656.4(logit)30.2 → 46.9

特权基线 GRPO+SDPO 在两个 Qwen 上低于纯 GRPO。域外 GPQA / IFEval / MMLU-Pro 没有掉,Qwen3-8B 的 OOD 均分从 70.6 升到 72.0。混合数学加 STEM 训练时,权重空间 RISE 的数学均分 44.8 对 GRPO 的 40.2,STEM 均分 47.5 对 45.5。代码上最终精度接近,HumanEval+ 达到 GRPO 终点的步数从 90 降到 50。Agent 上 Qwen2.5-3B 的 ALFWorld 从 75.0 到 84.4,WebShop Acc 从 63.3 到 74.2。

去掉 RLVR、只沿自蒸馏方向外推,60 步内 MATH-500 掉到 2.4%,长度顶到 8K。去掉 OPD、直接采用 θfuture,数学均分几乎不动(8B: 60.0 → 60.3)。外推给方向,蒸馏才把方向写成稳定增益。β=2 在训练早期还加分,到第 100 步已经灾难,这就是衰减日程的理由。

为什么重要

OPD 不必再绑一个更强的外部模型,也不必把标准答案塞进教师上下文。稀疏的结果奖励负责方向别走歪,外推教师负责把同一信号摊到 token 上。对已经在跑 GRPO 的团队,这是同一批 rollout 上的附加损失,换来竞赛数学上最大的一截,以及 agent 任务上大约 10 个点。

它不引入新的任务信息。奖励能被刷,外推就把刷分方向放大。

局限与存疑

方法赌训练轨迹足够低维、在不大的 β 下近似线性;作者测到三个方向大约解释 87% 的方差,但没有在线检测外推何时失效。代码基准很快饱和,增益小于数学。EMA 锚点在 Qwen 上有用,在 OLMo 上 η=1 更好(56.4 vs 50.1),锚点规则不能一套走天下。和需要外部强教师的 ExOPD 没法直接比,「不靠更强模型」是设计目标,不是同条件赛马。

术语

原文与代码

相关论文

全部论文解读