训练中知识蒸馏偏科:推理提升,事实记忆反受损
roydanroy · x · 2026-09-02
- @iScienceLuvr 引用一项 KD 研究:在预训练中期(mid-training)做 forward KL 蒸馏,若教师是后训练过的模型,行为与常规 NTP 训练截然不同——它能同时提升推理和事实记忆(相对标准预训练),但摘要被截断,暗示存在权衡。
- 回复者 hyhieu 关联到 arXiv 2310.04680《The Cost of Down-Scaling Language Models》:该研究通过剪枝与直接训练更小模型两种方式,发现缩到 70% 以下参数会显著损害预训练事实记忆(fact recall),而 30–60% 的缩减仍能大体保留上下文学习能力(ICL)——即缩放对「记忆」与「上下文推理」的影响天然不均衡,记忆先于 IC 退化。
- 两条线索共同指向:模型压缩/蒸馏并非能力等比缩水,事实性知识尤其脆弱。
「模型」频道最新
- 腾讯 WeMM 多模态嵌入模型发布,支持图文视频统一检索 — tomaarsen · 2026-09-02
- WeMM-Embedding 登顶 MMEB-v2:2B 版以四分之一参数反超 8B 模型 — tomaarsen · 2026-09-02
- 腾讯开源 WeMM-Embedding:文本图像视频统一嵌入,Apache 2.0 — tomaarsen · 2026-09-02
- 博主提出判据:当无人能追踪前沿模型进步时,闭源商业模型将失守 — StewartalsopIII · 2026-09-02
- Astra 传闻中的 looped transformer 并非黑科技:只复用层堆栈 — rasbt · 2026-09-02
- 爆料:Google Antigravity CLI 二进制中发现 GLM 5.2 引用 — gaganghotra_ · 2026-09-02