RL 视角解释 On-policy 蒸馏崩溃:隐性奖励被 hack 导致冗长重复输出

Han Cui · hf · 2026-10-08

On-policy 蒸馏(OPD)已成为语言模型后训练的重要方法,但也会坍缩成过长、重复的生成。论文从强化学习视角给出机制解释:教师模型对学生行为(包括它自己都很少表现的行为)存在隐式奖励。

关键发现:

结论是把关注点从「教师生成得多好」转向「它对学生 rollout 的评估有多可靠」。代码开源。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →