EOS token 失配致 OPD 蒸馏长度膨胀:一个 Qwen3 rollout 答对后多生成 7098 冗余 token

tw_killian · x · 2026-09-20

一篇新论文揭示了在线策略蒸馏(OPD)的一个隐性失败模式:在某次 Qwen3 rollout 中,学生模型仅用 1,094 个 token 就得出正确答案,随后却生成了 7,098 个冗余 token——模型在被变相惩罚“学会停止”。

论文由 BYU 新实验室与 Weitong Zhang 组的学生合作完成,已在 Hugging Face 发布。

所属事件:研究揭示 EOS token 失配致在线蒸馏输出膨胀(3 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →