按KL动态调度多教师蒸馏,关了97%师生差距且提速约3倍

D$^3$-MOPD: Adaptive Dynamic Domain ScheDuling for Efficient Multi-Teacher Distillation

Zechen Sun, Zhiwei Zhang, Fei Zhao, Juntao Li, Mu Chuan, Huayu Deng, Guojian Zhan, Wenliang Chen, Yao Hu, Min Zhang

cs.LG, cs.AI

2026-08-26

多教师on-policy蒸馏里各域收敛速度差一截,固定混合会把算力浪费在已平台的域上。D3-MOPD用现成的反向KL调采样比,Qwen3.6-35B-A3B关上97%师生差距(固定混合63%),约3倍步数到峰。

这篇在解决什么

Multi-teacher on-policy distillation(MOPD)让学生在自己的rollout上,按域最小化与对应专家教师的反向KL,把多个域专家合成一个模型。现有实现通常按题库大小把混合比{pk}提前钉死。单域实验里,数学KL前四分之一预算就掉下来见底,代码更慢,指令遵循的绝对KL全程高一到两个数量级。三域均匀混合时,代码大约第48步进低KL、数学第96步、指令遵循大约第144步,后半段仍各吃三分之一批次。固定混合是在给已经不再降KL的域续烧rollout。

方法

D3-MOPD把训练环原样留下,只改数据通路。学生照旧生成,教师照旧prefill,反向KL照旧算。一个离线watcher每隔n步读各域KL轨迹,合成两个量的乘积:剩余缺口(当前EMA KL相对开局KL)和下降速度(最近R个非重叠窗的相对下降,小于0则剪成0)。再经温度softmax加每域地板ε,写成新的{pk},分层采样器按这个比例拼batch,并加一点batch抖动。乘积的意思是:既还有空间、又正在下降,才多给样本;只剩高缺口但已平台,或已经见底只是还在抖,都不应占预算。地板避免某域被抽干后遗忘。watcher不挡训练,吞吐和vanilla只差约2.1%。

主实验学生是Qwen3.6-35B-A3B,四个同骨干、各用GRPO训过的教师覆盖数学、代码、指令遵循、工具使用。256个rollout步,batch 128。评AIME 2025、HMMT、LiveCodeBench、OJBench、IFBench、IFEval、BFCL v3。报告把学生记0、教师记1的归一化分,避免绝对分差大的域绑架平均。

结果

按各基准峰值,vanilla MOPD关上63%平均师生差,D3-MOPD关上97%,并在HMMT、IFEval、OJBench C++上超过对应专家教师。Vanilla均分峰值61.4出现在第143步;D3在第95步到62.3,第47步已经62.1,跨过vanilla的峰。代码基准最早见顶(约80步后开始掉),指令遵循最晚,和r-KL收敛顺序一致。

设定Best-S均分归一化师生差
Vanilla MOPD14361.360.63(峰值)
去掉速度项12761.41
去掉缺口项25561.46
D3-MOPD9562.340.97(峰值)

可部署的「最佳均分检查点」上,归一化分是0.73对0.48,D3仍在七项里六项更高。4B学生复现了同一方向:D3归一化1.01对vanilla 0.86,最佳均分步119对159。采样比轨迹像一门隐式课程:代码从0.25降到约0.15,数学在60到127步升到约0.50,随后指令遵循和工具使用被推到约0.55和0.50。

为什么重要

MOPD已经进了MiMo-V2-Flash、DeepSeek-V4这类大规模后训练流水线,但混合比一直当常数。这篇说明:损失里已经在算的分域KL,够当调度信号,不必另训预测器,也不改目标函数。域越多、收敛节奏越散,调度的期望收益越大。对正在做多专家合成的团队,这是改数据加载器就能用的渐进改进,峰值略高,达到可用点明显更快。

局限与存疑

主结果是一对对照,没有多随机种子。峰值表允许每个基准取不同检查点,97%那个数字偏乐观;同一检查点上是73%对48%。超过教师的三项,原本师生绝对分差就小(≤5.1),归一化后容易跨过1.0,不等于蒸出了新能力。调度超参(T=0.5、ε=0.10、R=3)只报了一组。指数衰减的理论论证是对乘积规则的事后解释。没和外部分域课程或交替训练直接比。

术语

原文与代码

相关论文

全部论文解读