EOS token 失配致 OPD 蒸馏长度膨胀:一个 Qwen3 rollout 答对后多生成 7098 冗余 token
tw_killian · x · 2026-09-20
一篇新论文揭示了在线策略蒸馏(OPD)的一个隐性失败模式:在某次 Qwen3 rollout 中,学生模型仅用 1,094 个 token 就得出正确答案,随后却生成了 7,098 个冗余 token——模型在被变相惩罚“学会停止”。
- 机制:基座学生模型与后训练教师模型即使声明的停止集合相同,也常偏好不同的 EOS token。逐 token 采样的 OPD 会压制学生偏好的 EOS,同时又无法可靠迁移教师的替代 EOS,导致学生“不会停”。
- 修正方法:把功能等价的多个 EOS token 的概率聚合为一个语义上的“停止动作”进行监督;仅对齐解码停止集合并不够。
论文由 BYU 新实验室与 Weitong Zhang 组的学生合作完成,已在 Hugging Face 发布。
所属事件:研究揭示 EOS token 失配致在线蒸馏输出膨胀(3 条相关)→
「模型」频道最新
- 反差观察:X 上被标记为 AI 代写的帖子多来自圈外人 — dylfreed · 2026-09-20
- 2 美元微调出专用分类器:Fireworks 教程称许多任务用不着前沿 LLM — bingxu_ · 2026-09-20
- Voyage AI 创始人:前沿模型「Ultra」档下依然「知道很多但根本笨」 — lateinteraction · 2026-09-20
- 用户从 Gemini 流向 Claude/Codex,讨论回归门槛有多高 — Helpful-Collar7159 · 2026-09-20
- 用户实测 OpenAI 20x 档:一小时烧掉一周额度的 5% — No_Twist_678 · 2026-09-20
- 西班牙 Multiverse 用 IBM 156 量子比特数据训练出 Quasar 1.1 438B 模型 — The_Wonderful_Pie · 2026-09-20