Nemotron 3 Ultra 技术报告:MOPD 多教师蒸馏中教师兼容性是关键
cwolferesearch · x · 2026-10-02
核心发现
作者从 NVIDIA Nemotron 技术报告中提炼了 Multi-Teacher On-Policy Distillation(MOPD)的关键细节:并非任意教师模型组合都能用于多教师在线蒸馏。
MOPD 工作原理
- 学生模型生成补全后,将 prompt + completion 路由给专家/教师模型
- 教师计算 token 级 log 概率
- 用反向 KL 目标(通常为采样近似)把教师能力蒸馏回学生策略
两种典型用法
- 整合(Consolidation):把多个领域专精模型的能力合并进一个学生,各领域训练可独立进行
- 恢复(Recovery):用训练早期 checkpoint 作为教师,修复多阶段训练中的能力回退
关键教训
Nemotron 3 Ultra 报告指出:训练管线差异过大的教师模型无法通过简单的 MOPD 合并生效。学生自己采样的轨迹对分布差异大的教师是 OOD,token 级监督随之失效——这对整合场景影响最大,恢复场景因师出同门天然规避。
解决方案
MOPD warmup:蒸馏前先用教师采样的多样化轨迹跑一个短 SFT 阶段,拉近学生与教师的行为分布。结论:MOPD 不是简单“把专家蒸给学生”,师生兼容性才是成败关键。
「研究」频道最新
- SYNTH 论文发现:模型「知道自己不知道」的能力从 3 亿参数起涌现 — cephaloform · 2026-10-02
- Failure Map 发布:20168 个 Python 边界 Bug 修复任务 — failuremap-f · 2026-10-02
- srush 发布抽样入门教程:核心直觉是方差缩减 — srush_nlp · 2026-10-02
- 研究者提议用自证账本解决行业共享基线缺失问题 — pratyusha_PS · 2026-10-02
- 新研究让AI模型「生儿育女」:靠互补配对繁殖而非梯度下降 — rvp · 2026-10-02
- MICCAI 2026 落幕,BrainWorks 等医学影像工作坊集中亮相 — PTenigma · 2026-10-02