知识蒸馏中训阶段存偏科风险,Meta 提出 Switch Distillation 缓解
一项 KD 研究发现,在预训练中期用 forward KL 蒸馏时,若教师是后训练过的模型,行为会与常规 NTP 训练截然不同:推理能力提升但事实记忆反而受损。针对这一偏科现象,Meta 发布研究提出 Switch Distillation,在中训练阶段依据教师模型的置信度选择性应用基于 logit 的知识蒸馏,从而在保留推理提升的同时不伤害事实回忆。
2026-09-02 ~ 2026-09-03 · 2 条相关
- 训练中知识蒸馏偏科:推理提升,事实记忆反受损 — roydanroy · 2026-09-02
- Meta 提出 Switch Distillation:中训练蒸馏保推理不伤事实回忆 — meta · 2026-09-03