EOS token 不一致导致在线蒸馏回答变长,HF 论文提出修复方案
Yuxiao Yang · hf · 2026-09-18
该研究系统分析了在线蒸馏(OPD)中的「长度膨胀」现象:学生模型回答可能异常冗长甚至耗尽生成预算。
关键发现:
- 根源之一是学生与教师模型的终止 token 不匹配——即便声明的停止集相同,Qwen3、Llama、Gemma 三大模型家族在具体 EOS token 上的停止概率分布也可能不同,导致学生的终止行为被抑制。
- 仅对齐解码停止集并不够;将功能等价的 EOS token 视为同一语义停止动作,可显著缓解长度膨胀。
- 对 K2-Horizon 不同训练阶段的 OPD 分析显示:终止偏好在训练中会大幅漂移,且 OPD 后期会出现一种即使对齐终止行为后仍持续存在的长度膨胀。
作者已发布包含终止处理修正的实现。
所属事件:研究揭示 EOS token 失配致在线蒸馏输出膨胀(3 条相关)→
「研究」频道最新
- 菲尔兹奖得主Villani谈OpenAI解千禧年难题:如数学史的末日浩劫 — GregCook2011 · 2026-09-20
- lateinteraction:论文只是时间戳格式,真正的项目「住」在别处 — lateinteraction · 2026-09-20
- 两名高中生借 AI 在菲尔兹奖得主研究问题上取得进展 — IgorCarron · 2026-09-20
- GPU 编程学习日志:精读 CUDA matmul 优化经典与 MIT 稀疏性课程 — NandoDF · 2026-09-20
- 新论文发现 grokking 第三阶段:训练后期泛化会崩溃回随机水平 — sytelus · 2026-09-20
- ICLR 投稿超 5 万篇,研究者提议人类与 LLM 混合编排评审 — HamedSHassani · 2026-09-20