研究显示知识蒸馏常难复现教师模型,学生还会放大其过度自信
deliprao · x · 2026-09-26
- Delip Rao 借 NeurIPS 2021 论文《Does Knowledge Distillation Really Work?》(Andrew Wilson 团队)指出:做类 Jev 的模型靠蒸馏是害自己——梯度下降即使从很近的初始点出发,也常找不到能复制教师模型输出的参数;学生还会系统性放大教师的过度自信。
- 论文结论:蒸馏能提升学生泛化,但教师与学生的预测分布常存在显著差距,即使学生有足够容量;更接近教师也不必然带来更好泛化。
- 观点:做正确的事终有回报,只为刷榜的模型用户一眼就能识破。
「研究」频道最新
- Anthropic:Claude 算出九圈散射振幅,打破物理学八圈纪录 — LucaAmb · 2026-09-26
- 微软开源Fabric-RLM:让LLM写代码递归处理大数据 — adnan_hashmi · 2026-09-26
- IEEE 探讨脑机接口时代的「精神隐私」防线如何跟上技术 — melnykowycz · 2026-09-26
- 《Foundations of LLMs》PDF获取方式与章节导读线程 — mdancho84 · 2026-09-26
- LLM教科书线程:第五章讲解码算法与推理时scaling — mdancho84 · 2026-09-26
- 277页LLM教科书《Foundations of LLMs》更新出新章节 — mdancho84 · 2026-09-26