中途蒸馏偏爱推理却伤事实记忆,Switch Distillation 两者兼得
StellaLisy · x · 2026-09-03
论文《Knowledge Distillation During Mid-Training Favors Reasoning over Factual Recall》揭示:训练中期的知识蒸馏确实提升推理能力,但会意外损害事实记忆——因为教师模型在知识密集型 token 上置信度低得多。
核心方法
- 提出 Switch Distillation:仅在教师模型熵低(置信度高)时蒸馏,否则回退到常规 next-token prediction。
结果
- 推理能力最高提升 1.71x
- 知识与常识提升 1.19x
- 同时保留约 97% 的事实召回能力
这项工作解释了蒸馏的隐含代价,并给出一个简单的开关式缓解方案。
所属事件:Meta 提出 Switch Distillation:中训练蒸馏不再偏科(3 条相关)→
「研究」频道最新
- 研究员:用写作解释事物是加深自我理解的最好方式 — sedielem · 2026-09-22
- 两阶段管线发现新型 RNA 病毒:ESM-2 粗筛 + 结构验证 — bravo_abad · 2026-09-22
- GAE 发布:在几何原生潜空间直接生成视频与 3D 点云 — yshan2u · 2026-09-22
- 别把矩阵当数字表格:矩阵即图,乘法即网络信号传递 — TivadarDanka · 2026-09-22
- Gary Marcus 质疑 OpenAI 对 Navier-Stokes 求解的夸大宣称 — GaryMarcus · 2026-09-22
- 业界重读2019年BERT论文:研究者称旧研究被从零重新发现 — sebgehr · 2026-09-22