SCOUT 框架修复 on-policy 蒸馏中教师的 off-policy 失配

AWS · hf · 2026-10-01

AWS 团队论文指出 on-policy 蒸馏(OPD)存在根本性不对称:学生自己采样的轨迹对教师而言是 off-policy 的——教师习惯于从自身策略的前缀续写,却要在蒸馏中监督学生生成的前缀,实测表明前缀越长教师续写质量下降越明显。

为此提出 SCOUT(Student-COnditioned Updates of the Teacher)共训练框架:在常规 OPD 更新之外,周期性地用可验证奖励的强化学习优化教师的条件续写能力——教师从学生前缀生成续写并根据结果奖励学习。

控制实验验证了学生条件化教师适配的机制,且在多组师生配置、模型规模和推理任务上,SCOUT 均稳定提升 OPD 的蒸馏效果。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →