MOPC 能去掉 OPSD 的自教缺陷,但多教师平均可能蒸馏出风格而非能力
novasarc01 · x · 2026-09-28
作者讨论多教师在线策略蒸馏(MOPD)相对单教师(OPSD)的一个关键优势:模型不必再利用特权上下文「自我教学」,而是可以使用真正更强、领域专属的教师模型。
但他指出这会带来「偏差选择」问题:朴素地对多个教师的损失取平均很奇怪,最终可能蒸馏到的是教师的风格和教师之间的分歧,而非真实能力。
他提出的方向是「选择性 MOPD」:根据教师梯度是否可能提升下游奖励,动态加权或门控教师梯度。关键在于能否在线低成本地估计这一点(避免大规模反事实 rollout 的开销)。他认为这比原始的多教师蒸馏是强得多的方向。
「研究」频道最新
- 推理工程档案上线:从第一性原理到生产环境的完整学习资源 — soham_btw · 2026-09-28
- OpenAI 用数千智能体解 Navier-Stokes 难题,数学家忧暴力求解侵蚀艺术性 — nordicinst · 2026-09-28
- 东京大学用人体细胞培养活体皮肤包裹机械手指,可自愈 — TinfoilTricorn · 2026-09-28
- Thales 用扩散模型修卫星测绘高程图,城市 RMSE 从 6 米降到 3.45 米 — thalesgroup · 2026-09-28
- Stanford 开源 HomeBody:给前沿 VLM 装上空间记忆与人形技能库 — CyberRobooo · 2026-09-28
- 英国初创把游戏手柄操作变成世界模型训练数据 — nordicinst · 2026-09-28