同族教师蒸馏能跨域迁移,多教师按域路由却会此消彼长

Every Coin Has Two Sides: On the Dual Nature of Generalization in On-Policy Distillation of Large Language Models

Zhaoyi Li, Deyang Kong, Yuan Wei, Evan Yang, Ranran Shen, Mahardika Krisna Ihsani, Ming Yang, Wei Zhang, Chuan Hao, Jian Yang, Ran Tao, Bryan Dai, Shikun Zhang, Wei Ye, Ying Wei, Defu Lian

cs.CL

2026-08-17

策略蒸馏对题目难度几乎不敏感,同族教师能跨语言、长程和跨域迁移;多教师按域路由挡不住外溢,学生能力随混合比此消彼长。

这篇在解决什么

On-policy distillation(OPD)让学生用自己采样的轨迹去对齐教师的 token 分布,用来减暴露偏差。现有工作多在单一域、跟训练集很近的榜上报告涨点,分不清是「把这批题拟合了」还是「把教师的推理习惯搬走了」。多教师 OPD(MOPD)还默认按题路由到领域专家,以为互不干扰。

中科大、北大、IQuest 等做了一组一次只改一个因素的对照:域内难度、语言、推理长度,再到跨域,最后到多教师混合。

方法

损失是学生与教师的反向 KL,实践里用采样 token 的 k1 近似,写成 policy-gradient:教师比学生更看好的 token 被加强,反之压掉。同族(same-origin)指师生来自同一基座,通常学生是 SFT、教师是同一检查点上 RL 出来的;跨族(cross-origin)则基座不同。数学默认训 BigMath,评 AMC2023、MATH-500、AIME2025/2026、BeyondAIME、OlymMATH-Hard;语言偏移看中文奥数,长程看把多道题拼起来的 Horizon 子集。代码训 DeepCoder、评 LiveCodeBench;科学训 TextbookReasoning 和 SCP-116K、评 GPQA-Diamond;指令遵循训 Nemotron-IF、评 IF-Eval。

结果

教师 pass-rate=1、=0 和随机各 25K 题,三组收敛到几乎同一准确率。极容易的 GSM8K 和极难的 DeepMath-103K(难度>8)仍能收回 BigMath-random 超过 80% 的 OPD 增益,两者最终均分差不到 2 分。学生侧动态丢掉已经全对的题有一点用:

师生对过滤六项均分
Polaris-7B → DS-distill-1.5B不过滤 / 丢掉已会的题41.4% / 42.0%(+0.6)
Light-R1-14B → DS-distill-7B不过滤 / 丢掉已会的题52.4% / 52.8%(+0.4)

只留全对或全错都没有增益。只在英文短题上训,中文和长程数学也涨;但跨族更强的教师(Light-R1-14B)带 7B 学生,长程上几乎没超过初始模型,同族较弱的 Polaris-7B 反而把学生拉到接近教师。

跨域更硬。同族下,用数学 prompt 训,LiveCodeBench 和 GPQA 也能靠近教师;反过来用代码或科学 prompt,数学(含中文和长程)同样靠近教师。教师在科学上弱于学生时(JustRL-1.5B),数学或科学 prompt 都会把 GPQA 拉下去。跨族则域内明显高于跨域:代码 prompt 训出来的 LiveCodeBench 曲线,稳定高于数学 prompt 那条。

MOPD 里按域路由挡不住这种外溢。JustRL(数学强)和 Nemotron(科学/IF 强)对 DS-distill-1.5B,只改 prompt 比例、题总量不变:

JustRL/NemotronBeyondAIME+OlymMATH 均分
25/827.1%
1/126.3%
2/2525.1%

加 JustRL 份额,GPQA、LiveCodeBench、IF-Eval 一起朝 JustRL 的低分靠,GPQA 训练早期可掉约 5 个点。对调两人的领域标签,三条榜随 Nemotron 份额上升。级联实验里,先跟 Nemotron 学科学把 GPQA 拉高,再切到 JustRL 学数学,GPQA 掉回去。Top-16 token 重叠:同族一开始就更高、训练中继续升;跨族持平或下降。同族教师在 1:1 混合里拉力也更大。

为什么重要

挑题按教师会不会做,对 OPD 几乎不值当;该看师生是不是同一条后训练血统。单教师同族时,跨语言、跨长度、跨域都能搬能力,这是优点。多教师时同一机制变成互相拖拽:学生某域差,不一定怪该域教师,可能是另一个教师在跨域拉。路由不能当能力隔离,更不能当安全边界。

局限与存疑

实验停在推理模型,数学、代码、科学、指令遵循四类,没有多模态、工具和交互 agent。MOPD 只用两个互补教师、固定按域路由,专家池变大或改成自适应路由会怎样,没有数据。同族优势的机制解释停在 top-k 重叠,没有更细的表征分析。「教师不会做的题也有用」建立在 token 级 KL 上,换离线答案蒸馏未必成立。

术语

原文与代码

相关论文

全部论文解读