论文找到 On-Policy 蒸馏失效元凶:EOS token 不匹配
tw_killian · x · 2026-09-21
Gurtej Gill 转评一篇解决 On-Policy Distillation 失败模式的论文。已知问题:student 的 rollout 会变得过度冗长,耗尽整个生成预算。论文定位到机械性根因——base student 与 post-trained teacher 之间的终止 token 不匹配:即使两者声明的停止集合完全相同,其学到的概率质量也落在完全不同的 EOS token 上。student 每次想用自己偏好的 token 停止,teacher 都视为错误延续并施加陡峭惩罚,主动压制 student 的终止本能,却没有迁移 teacher 偏好的替代 token。作者还证明仅对齐解码停止集合并不能解决问题,真正修法是把功能等价的 EOS token 视为同一类(帖文在此截断)。
「研究」频道最新
- Jev 被指与 8 个月前论文 autorubric 评测抽象几乎一一对应 — deliprao · 2026-09-21
- 研究者称 TypeSafe 的 Jev 抽象与其 8 个月前 Autorubric 论文高度相似 — deliprao · 2026-09-21
- ICLR 2027 投稿超 6 万篇,研究者提议限每人 3-4 篇 — ziv_ravid · 2026-09-21
- ICLR 2027 投稿破 6 万篇,研究者吁全面改革会议制度 — ziv_ravid · 2026-09-21
- Laya 并非仅支持 512 上下文:实为 ModernBERT,配置上限 8192 — antoine_chaffin · 2026-09-21
- 开源决策模型 Kev 发布 0.6B/4B/8B,单张 H100 训练 40 分钟 — TheMoonMidas · 2026-09-21