研究发现知识蒸馏在 mid-training 阶段牺牲事实记忆换推理
LukeZettlemoyer · x · 2026-09-16
Luke Zettlemoyer 转发其团队的 arXiv 论文([2609.01532]),系统研究了 logit-based 知识蒸馏(KD)在不同训练阶段的效果差异:
- 核心发现:forward KL 蒸馏在预训练阶段能同时提升推理与事实记忆(相比标准 next-token prediction),但在 mid-training(在精选语料上的自监督中间阶段)却会在推理继续提升的同时拖慢事实记忆的习得。
- 机制解释:教师在程序性数据上比知识密集型数据上更自信,而学生在训练早期就先学到低熵的事实知识,这种不对称导致 mid-training 阶段蒸馏失真。
- 提出的解法:Switch Distillation——以教师预测熵作为轻量路由信号,只在教师自信的 token 上蒸馏,其余回退到交叉熵,缓解该取舍。
论文作者来自 UW/AI2/Meta 等,含 Pang Wei Koh、Luke Zettlemoyer、Wen-tau Yih。对做小模型 mid-training 的团队有直接参考价值。
「模型」频道最新
- Cartesia 新语音模型家族获赞:WER 之外提出语境正确性评测思路 — buckymoore · 2026-09-16
- 网友复现评测:GPT-Astra 无思维链计算能力出现质的飞跃 — dhadfieldmenell · 2026-09-16
- Codex $200/月套餐也能用满:Burkov 实测后转回 Claude Astra — ruslansv · 2026-09-16
- DeepSeekMath-V2 把验证做成产品:验证算力随生成器一起扩展 — le_james94 · 2026-09-16
- ChatGPT Plus「Work Projects」失联 bug 三天未修,OpenAI 却已关单 — OnwardUpwardForward · 2026-09-16
- 曝 Google 打造数学特化模型 Gemini DeepThink Mathematica — basedjensen · 2026-09-16