跨 tokenizer 在线蒸馏研究:监督可靠性比覆盖度更关键
Bingxi Hou · hf · 2026-10-07
Hugging Face 上的新论文研究异构 tokenizer 之间的在线蒸馏(OPD)。
- 背景:OPD 用教师反馈在学生自身生成上训练,但 tokenizer 不同时需在序列与词表两层对齐教师与学生预测。
- 核心发现:在 3 组异构师生对(数学推理与代码生成)上,严格的 1:1 对齐组已覆盖绝大多数学生生成 token;共享词表在对齐位置上保留了几乎全部概率质量。
- 关键结果:将对齐位置的 reverse KL 限制在学生选定的 top-16 共享词包子集,即可达到与全共享词表 OPD 相当的精度,优于已评测的跨 tokenizer 基线。
- 反直觉发现:对不匹配组补上 span log-prob 的 MSE 监督虽实现了完全监督覆盖,反而降低精度;仅用 strict loss 训练时,span 梯度与 strict 梯度方向一致性弱甚至为负,且幅值相对增长。
- 结论:应从最大化对齐覆盖转向优先保证监督可靠性——严格位置的紧凑监督比引入弱对齐或冲突信号的大范围覆盖更有效。
「研究」频道最新
- π 的无理性指数上界压到 6.0446,证明已用 Lean 4 完整形式化 — Michael_D_Moor · 2026-10-07
- 3-sum 降到 n^1.999 让人担心数学「丑陋」?换个视角又美了 — thomasahle · 2026-10-07
- NVIDIA 发布 UNREAL:一个模型统一语料检索与 128K 长上下文 — nvidia · 2026-10-07
- 实测 LLM 当 RAG 质量评审:gpt-4.1-nano 仅比瞎猜略好 — Giulio Zeloni · 2026-10-07
- SlimWise 解耦 MoE 前后阶段专家剪枝,解码吞吐最高提升 1.81 倍 — Gunho Park · 2026-10-07
- 从纯像素学出判别性表示,Drifting Models 的 FID 降低 82–95% — Doudou Zhang · 2026-10-07