MOPC 能去掉 OPSD 的自教缺陷,但多教师平均可能蒸馏出风格而非能力

novasarc01 · x · 2026-09-28

作者讨论多教师在线策略蒸馏(MOPD)相对单教师(OPSD)的一个关键优势:模型不必再利用特权上下文「自我教学」,而是可以使用真正更强、领域专属的教师模型。

但他指出这会带来「偏差选择」问题:朴素地对多个教师的损失取平均很奇怪,最终可能蒸馏到的是教师的风格和教师之间的分歧,而非真实能力。

他提出的方向是「选择性 MOPD」:根据教师梯度是否可能提升下游奖励,动态加权或门控教师梯度。关键在于能否在线低成本地估计这一点(避免大规模反事实 rollout 的开销)。他认为这比原始的多教师蒸馏是强得多的方向。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →