蒸馏后的小模型可能因更强泛化反超老师

peterjliu · x · 2026-07-25

作者认为,如果最大规模的 LLM 其实存在过参数化,那么蒸馏出来的学生模型反而可能比老师更强。理由是:大模型的一部分优势来自记住更多事实,而小模型在更小容量下被迫完成同样任务,可能会因此学到更好的泛化能力。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →