论文找到 On-Policy 蒸馏失效元凶:EOS token 不匹配

tw_killian · x · 2026-09-21

Gurtej Gill 转评一篇解决 On-Policy Distillation 失败模式的论文。已知问题:student 的 rollout 会变得过度冗长,耗尽整个生成预算。论文定位到机械性根因——base student 与 post-trained teacher 之间的终止 token 不匹配:即使两者声明的停止集合完全相同,其学到的概率质量也落在完全不同的 EOS token 上。student 每次想用自己偏好的 token 停止,teacher 都视为错误延续并施加陡峭惩罚,主动压制 student 的终止本能,却没有迁移 teacher 偏好的替代 token。作者还证明仅对齐解码停止集合并不能解决问题,真正修法是把功能等价的 EOS token 视为同一类(帖文在此截断)。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →