NTU 提出 DN-MOPD:按域归一化反馈强度修复多教师蒸馏失衡

NanyangTechnologicalUniversity · hf · 2026-09-29

南洋理工大学研究多教师 on-policy 蒸馏(MOPD):让 RL 训出的多个单技能专家共同教一个学生。发现问题在于各域反馈强度失衡——instruction-following 反馈的分布宽度是数学的数倍,主导了学生更新,导致学生学不到数学专家的优势。

结论:合并多个专家不仅要决定谁教,还要决定其反馈的强度。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →