详解 MOPD:多教师在线蒸馏把多个专精模型合并进一个学生模型

cwolferesearch · x · 2026-10-07

AI 研究博主 Cameron Wolfe 详解多教师在线蒸馏(Multi-Teacher On-Policy Distillation, MOPD):把多个领域专精教师模型的能力合并进单个学生模型的技术路线。

OPD 基础:在线蒸馏以学生视角进行——由学生从 prompt 生成 rollout,教师为学生在 rollout 中生成的每个 token 计算概率,用反向 KL 目标训练学生去匹配教师。即用教师为学生的实际行为打分,而非让教师自己生成轨迹。

扩展到多教师:MOPD 不是用同一个教师打分所有 rollout,而是按领域路由——SWE 类 rollout 由 SWE 教师打分,聊天 prompt 路由给对话教师。

密集监督优势:结果导向的 RL 给整条轨迹一个奖励,而 OPD 在每个 token 上都有监督信号,样本效率更高;两者也可结合,同时学习教师概率与任务奖励。

教师训练与兼容性:教师可独立针对推理、编码、SWE、搜索等能力各自定制后训练管线(SFT/RLVR/RLHF 组合),如 Nemotron 3 Ultra 就训练了约 10 个教师模型。但教师行为若与学生分布差异过大,rollout 会落在教师分布外、监督信号减弱——可通过 MOPD warmup(先用教师 rollout 对学生做 SFT)缓解。

动机:跨多域扩展 RL 很困难——域越多每个能力分到的 rollout 越少、域间相互干扰、rollout 长度与验证成本差异拉大训练开销,MOPD 提供了另一条合并能力的路径。

所属事件:多教师在线蒸馏新进展:单一学生模型可超越每位教师(2 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →