Weak-to-Strong On-Policy Distillation
Fangxu Yu, Zinan Lin, Xiaodong Liu, Weijia Xu, Michael Xu, Tianyi Zhou, Jianfeng Gao
cs.LG
2026-07-29
微软研究院 W2S-OPD 把两个弱模型的 logit 差当代理教师;8B 学生数学反超 4B 专家,且所有监督源都更弱时仍能提升。
On-policy distillation(在线策略蒸馏,OPD)让一个学生模型在自己生成的推理轨迹上对齐教师的 token 分布,已经成为把能力从大模型搬给小模型的主流做法。但它有个硬前提:教师至少要和学生一样强。真到了前沿模型这一档,这个前提撑不住。
两种常见用法都卡在「教师」上。把更大的模型蒸馏给更小的,问题是前沿之上没有更大的教师,这条路到顶就断。另一条是 MOPD 那种,从同一个基座训出多个领域专家再合并,每个专家都得训到学生这一档的规模,成本随学生规模膨胀。W2S-OPD(作者来自微软研究院、马里兰大学和 MBZUAI)想反过来问:能不能用一堆比学生还弱的模型当教师,把强学生再往上推。
核心 trick 在 logit 空间里造一个「代理教师」。挑一对弱模型当正负样本:正模型 m⁺ 和负模型 m⁻,两个都比学生小、都便宜。代理教师这样定义:
πT,α(·|st) = softmax(zbase(st) + α(z⁺(st) − z⁻(st)))
z⁺ 减 z⁻ 这一步是关键。两个模型规模都比学生小,但它们的差恰好把「能力方向」隔离出来——m⁺ 比 m⁻ 多出来的那点偏移,正是这种能力带来的。把这个方向加回学生自己的基座 logits,代理教师既注入了能力方向,又紧贴学生的分布,不至于带学生跑偏。α 是放大系数,控制注入信号的强度。
学生再对这个代理教师做标准 Top-k OPD:在自己生成的 rollout 上最小化每 token 的反向 KL。相比普通 OPD,只是多前向三个冻结的小模型(基座 + 正 + 负)取 logits,这些小模型不训。
论文给了三种凑这一对的方式,各隔离不同来源的能力:
学生是 Qwen3-8B,教师只用 4B 这一档。数学取 AIME24、AIME25、HMMT25 二月和十一月四个基准平均,代码取 HumanEval+、MBPP+、LiveCodeBench-V6 三个基准平均:
| 方法 | 数学 avg | 代码 avg |
| 学生基座 8B | 17.0 | 57.6 |
| 4B-RL 教师 | 48.8 | 61.5 |
| OPD(单教师) | 46.5 | 58.7 |
| W2S-OPD(单教师) | 51.8 | 60.9 |
| W2S-OPD(多教师) | 52.1 | 61.1 |
最反直觉的一行:W2S-OPD 数学 51.8,反超了它学习的 4B-RL 教师自己(48.8),而普通 OPD(46.5)还停在教师之下。相对 OPD 的提升,单教师 11.4%、多教师 12.0%。
把场景推到极致,两个教师(4B、0.6B 基座)都不如学生且完全免训练,W2S-OPD 仍把数学从 17.0 抬到 23.0。对错提示那档只靠一个 0.6B 模型和「喂不喂正确提示」的差,也能让数学从 17.0 升到 18.4。监督源全比学生弱,学生照样被往上推。
迁移到域外也成立:GPQA-Diamond 上 OPD 54.4、W2S-OPD 56.5;IFBench 上 OPD 反而把学生从 26.3 压到 25.9,W2S-OPD 能抬到 27.0。
三种对比对并非冗余。把推理 token 按 Schoenfeld 的八类解题动作打标,看被加强最猛的前 1% token 的分布:post-RL 对比对的 Plan 占比从基线 8.6% 升到 15.7%、Monitor 从 0.5% 升到 1.8%;规模对比对的 Analyze 升到 44.4%、Implement 27.7%;对错提示那档 Plan 升到 20.2%、Answer 从 3.8% 升到 16.4%。post-RL 和提示对比对强化的是「怎么想」的推理框架,规模对比对强化的是「怎么算」的求解流程。
代价不大。W2S-OPD 每步训练只比单 4B 教师 OPD 多约 20% 时间,因为前向三个冻结小模型的开销被 rollout 生成这块大头盖住了。
这篇把 weak-to-strong 从「能不能从弱监督里学到东西」往前推成了「怎么从一堆弱模型里把能力方向抽出来再放大」。对从业者最直接的用处在前沿这一档:训的模型已经是手上最强的、没有更大教师可借时,W2S-OPD 给了一条用更小更便宜的弱模型继续涨点的路。三种凑对方式覆盖了现实里几乎所有能拿到的弱模型来源:RL 前后的 checkpoint、不同规模的基座、甚至给同一模型喂不同提示。
需要泼点冷水。17.0 到 51.8 这个大涨专门来自 post-RL vs pre-RL 这一种对比对,而它要求你已经在一个 4B 模型上跑过 RL、手里有那个专家 checkpoint,也就是说 4B 规模的 RL 训练成本是付过的。两种只用现成免训练模型的方式,绝对提升小得多(23.0 和 18.4)。免费的弱监督有点用,但大头胜利仍靠一个训过的专家撑着。
作者自己点出的开放问题:弱监督源能把更强的学生推到多远才饱和、怎么从弱模型里挖出更有信息量的信号、这套范式能不能成为后训练的常规手段,目前都没有答案。
α 这个放大系数靠手调。论文坦承 α 太小信号太弱、太大扭曲分布把代理教师推离学生,合适的 α 要逐场景找,没有自动确定的办法。
三种对比对带来的信号差异很大,但论文没给「怎么给一个新任务挑最合适的对比对」的判据。多教师那条路目前只是按路由把最合适的对配上去,路由本身依赖现成的领域标注。
结果只在 Qwen3 系列上验证,跨模型族(比如 Llama)能不能复现没有数据。