NeurIPS 论文 CaRE-KD:让学生模型学会何时该信任蒸馏教师
Tanmoy_Chak · x · 2026-10-03
- 知识蒸馏中教师模型会幻觉,标准 KD 却强制学生照搬,把概率质量浪费在教师嘈杂、低置信度的预测上,并覆盖学生本已正确的先验。
- 被 NeurIPS 2026 接收的 CaRE-KD 让学生自己决定何时信任教师:
- token 级:置信度门控根据教师确定程度,在 mean-seeking 与 mode-seeking 散度之间切换;
- 序列级:拒绝机制丢弃教师在认知上不如学生可靠的更新。
- 预印本已发布。
「研究」频道最新
- 斯坦福教授批 AI×Bio 研究:实验设计功底严重不足 — anshulkundaje · 2026-10-03
- 斯坦福教授提醒 AI×Bio 新人:先补实验设计与对照的概念 — anshulkundaje · 2026-10-03
- 斯坦福教授喊话 AI 转行者:进湿实验室先学懂「对照」 — anshulkundaje · 2026-10-03
- 推文线程论证 BPB 度量缺陷:tokenizer 三难困境无法全满足 — RylanSchaeffer · 2026-10-03
- 研究者证明「分词器三难困境」:三个合理指标只能取其二 — RylanSchaeffer · 2026-10-03
- 「Tokenizer 神话与迷思」讲座幻灯片发布:破除分词器常见误区 — RylanSchaeffer · 2026-10-03