ToMoE 论文:无需微训即可将稠密模型转为 MoE

pmttyji · reddit · 2026-08-24

ToMoE 提出了一种通过动态结构剪枝将稠密大语言模型转换为混合专家模型的方法。该方法在不永久删除参数的前提下减少激活参数数量,通过将 MLP 层转换为 MoE 架构来保持固定数量的活跃参数。实验表明,即使无需微调,该方法在 Phi-2、LLaMA-2/3、Qwen-2.5 等模型族上均优于以往的结构剪枝技术。项目代码已在 GitHub 开源。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →