MOPD-Router:token 级教师路由,多教师在线蒸馏最高提升 12.3%
GAIR · hf · 2026-09-28
GAIR 团队发布 MOPD-Router,改进多教师在线蒸馏(MOPD)的教师路由机制:
- 问题:现有做法按 prompt 硬路由到单一领域教师,依赖领域标签,浪费其他教师的互补信号,也无法利用无标注混合数据。
- 方法:在 token 级对全部教师池进行监督路由,无需领域标签、无需训练单独的路由模型;提出可插拔接口支持不同打分指标。
- ExpertAlign:按教师对学生在当前 token 修正是否体现其专长来打分,对比基于教师置信度(Entropy)和师生差异(Novelty)两个基线。
- 结果:在强到弱与同尺寸蒸馏、有无标注混合数据四种设置下均最优;无标注数据上比 Mean 聚合提升 5.88 分(+12.3%),有标注数据上比标准 MOPD 提升 3.95 分(+7.8%)且未用领域标签。
代码已开源。
「研究」频道最新
- Simon Prince 新教程:从残差网络推导 Neural ODE — SimonPrinceAI · 2026-09-28
- 小米开源 7000+ RL 环境,HF Space 可视化运行 rollout — SergioPaniego · 2026-09-28
- 67k 轨迹实测:77.8% 的 agent 运行携带过期文件视图,上下文刷新层这样建 — jabulari · 2026-09-28
- GPT Researcher 弃用 embeddings 实测:上下文相关性提升 59% — hwchase17 · 2026-09-28
- Meta 研究 RL-XAR:用专家对齐评分表做 RL,宣称解决 AI slop 写作问题 — jaseweston · 2026-09-28
- Policy-DRIFT 获 NeurIPS 接收,减阻 49% 超越 DRL 基线 — ricardovinuesa · 2026-09-28