详解 MOPD:多教师在线蒸馏把多个专精模型合并进一个学生模型
cwolferesearch · x · 2026-10-07
AI 研究博主 Cameron Wolfe 详解多教师在线蒸馏(Multi-Teacher On-Policy Distillation, MOPD):把多个领域专精教师模型的能力合并进单个学生模型的技术路线。
OPD 基础:在线蒸馏以学生视角进行——由学生从 prompt 生成 rollout,教师为学生在 rollout 中生成的每个 token 计算概率,用反向 KL 目标训练学生去匹配教师。即用教师为学生的实际行为打分,而非让教师自己生成轨迹。
扩展到多教师:MOPD 不是用同一个教师打分所有 rollout,而是按领域路由——SWE 类 rollout 由 SWE 教师打分,聊天 prompt 路由给对话教师。
密集监督优势:结果导向的 RL 给整条轨迹一个奖励,而 OPD 在每个 token 上都有监督信号,样本效率更高;两者也可结合,同时学习教师概率与任务奖励。
教师训练与兼容性:教师可独立针对推理、编码、SWE、搜索等能力各自定制后训练管线(SFT/RLVR/RLHF 组合),如 Nemotron 3 Ultra 就训练了约 10 个教师模型。但教师行为若与学生分布差异过大,rollout 会落在教师分布外、监督信号减弱——可通过 MOPD warmup(先用教师 rollout 对学生做 SFT)缓解。
动机:跨多域扩展 RL 很困难——域越多每个能力分到的 rollout 越少、域间相互干扰、rollout 长度与验证成本差异拉大训练开销,MOPD 提供了另一条合并能力的路径。
所属事件:多教师在线蒸馏新进展:单一学生模型可超越每位教师(2 条相关)→
「模型」频道最新
- Ollama 上架 Google EmbeddingGemma 2:740M 多模态嵌入模型 — ollama · 2026-10-07
- Reddit 用户吐槽 ChatGPT 频繁误判违规:"对不起,戴夫"式拒绝越来越多 — Crixusgannicus · 2026-10-07
- Runware API 上线两款内容审核模型,政策用自然语言描述即可 — aziz4ai · 2026-10-07
- Ethan Mollick 提醒 AI 实验室:先确保自家模型会用自家产品 — emollick · 2026-10-07
- OpenAI 推出 Decisions API 公测:比 GPT-6 Luna 快 10 倍替应用做决策 — OpenAIDevs · 2026-10-07
- Cloudflare 开源视觉决策模型 clef,速度惊艳引热议 — michellechen · 2026-10-07