斯坦福学者揭示大模型保留罕见技能原因:容量竞争

SinclairWang1 · x · 2026-08-14

斯坦福 NLP 研究员 Jing Huang 在讲座中解释了为什么大模型能保留小模型容易丢失的罕见技能。

核心原因在于训练过程中的任务间干扰:模型容量有限,各任务会相互竞争。小模型容量不足,长尾的罕见任务容易被挤出;而大模型有充足的参数空间来容纳这些边缘能力。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →