MoE-to-Dense 入选 NeurIPS 2026 Oral:不重训从 MoE 蒸出稠密小模型

Kangwook_Lee · x · 2026-09-30

论文《MoE-to-Dense》入选 NeurIPS 2026 oral presentation(悉尼)。研究的动机是:如今几乎所有旗舰模型都是 MoE 架构,但小模型因面向内存受限场景、总参数量敏感,仍偏好稠密架构。

论文提出的问题:能否利用现成的 MoE 直接产出稠密模型,而无需从零训练?这为从大 MoE 模型中高效提取适合端侧/内存受限部署的小型稠密模型提供了一条路径。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →