小红书D³-MOPD动态蒸馏:师生差距弥合97%,收敛提速3倍
小红书技术REDtech · wechat · 2026-09-07
小红书 AllSpark 团队针对多教师在线蒸馏(MOPD)中固定数据配比的问题提出 D³-MOPD:早收敛领域(如数学、代码)持续占用算力,而真正需要训练的领域(如指令遵循)分不到数据。
核心思路
- 直接复用训练本就计算的 reverse-KL 信号作为"打分员",几乎零额外开销
- 复合打分 = "还差多少"(当前KL/初始KL)× "进步多快"(近期KL下降速度),两项相乘,缺一不可,再经 Softmax 转为配比
- 加最低配比保底防止遗忘,温度参数控制倾斜强度
- 架构轻量:异步观察者进程 + 分层采样器,主训练循环零改动,可与其它 RL 技术叠加、领域数量不限
实验结果(Qwen3.6-35B-A3B,四位教师覆盖数学/代码/指令遵循/工具调用,7 个基准)
- 师生差距弥合 97%(Vanilla MOPD 仅 63%),HMMT、IFEval、OJBench C++ 三项反超教师
- 达到平均 61.4 分,Vanilla MOPD 需 143 步,D³-MOPD 仅需 47 步,收敛提速 3 倍
- 配比演化呈现"算力接力":代码从 25% 降至 15%,算力先流向数学(一度 50%),数学收敛后再转移至指令遵循与工具调用(50%-55%)
论文:arxiv.org/abs/2608.24987
「研究」频道最新
- JEVfire 开源:Qwen 0.8B 在浏览器里 71ms 一步通关超级马里奥 — ricklamers · 2026-09-22
- RegVGGT:每帧仅留 1% token,消费级 GPU 跑长视频 3D 重建 — zhenjun_zhao · 2026-09-22
- D3GS:深度+DINO+扩散三重引导,稀疏视角 3DGS 重建显著提升 — zhenjun_zhao · 2026-09-22
- VGGT-Prime:用路由给注意力头分级,削减视觉几何 Transformer 冗余算力 — zhenjun_zhao · 2026-09-22
- Elevator-VIGS:VLM 零样本识别电梯,SLAM 乘电梯不再丢失跟踪 — zhenjun_zhao · 2026-09-22
- BayesianGS-SLAM:用贝叶斯不确定性统一 3DGS 建图与跟踪 — zhenjun_zhao · 2026-09-22