RL 视角解释 On-policy 蒸馏崩溃:隐性奖励被 hack 导致冗长重复输出
Han Cui · hf · 2026-10-08
On-policy 蒸馏(OPD)已成为语言模型后训练的重要方法,但也会坍缩成过长、重复的生成。论文从强化学习视角给出机制解释:教师模型对学生行为(包括它自己都很少表现的行为)存在隐式奖励。
关键发现:
- OPD 提升成绩但并不扩展学生能力边界,只是让正确回答更容易被采样。
- 当隐式奖励模型与质量不一致时发生 reward hacking:隐式奖励放大过长、重复的学生 rollout,即便教师自己很少生成这类文本。
- 缓解手段:训练时屏蔽不健康响应,以及使用 SFT 初始化,均能有效抑制坍缩。
结论是把关注点从「教师生成得多好」转向「它对学生 rollout 的评估有多可靠」。代码开源。
「研究」频道最新
- Scott Aaronson:AI 公司已尝试用内部模型破解密码学协议 — skdh · 2026-10-08
- Yukon 开放式自动科研平台:人机同场刷纪录,多项成绩超 Google Quantum AI — RexDouglass · 2026-10-08
- OpenAI 数学仓库更新:约 42% 顶线结果已 Lean 形式化,3 篇撤稿 — danintheory · 2026-10-08
- D-OPCD 把 Agent 经验蒸馏进扩散模型权重,四基准平均分升至 65.09 — Wenxuan Wang · 2026-10-08
- 四叉树视觉分词器 QuadTok:省 10% token,ImageNet 达 2.08 gFID — Yucheng Mao · 2026-10-08
- PhysEvo 让冻结模型物理递归自我改进:RoboDojo 42 任务成功率 62% — Wenqing Tian · 2026-10-08