ToMoE 论文:无需微训即可将稠密模型转为 MoE
pmttyji · reddit · 2026-08-24
ToMoE 提出了一种通过动态结构剪枝将稠密大语言模型转换为混合专家模型的方法。该方法在不永久删除参数的前提下减少激活参数数量,通过将 MLP 层转换为 MoE 架构来保持固定数量的活跃参数。实验表明,即使无需微调,该方法在 Phi-2、LLaMA-2/3、Qwen-2.5 等模型族上均优于以往的结构剪枝技术。项目代码已在 GitHub 开源。
「模型」频道最新
- 研究反转:中国开源模型成论文默认选择 — xeophon · 2026-08-24
- RTX 4070 Ti + Mac Air 跑 Qwen3.8 27B 达 11.7 tok/s — zannix · 2026-08-24
- Teutonic-II 110B 开源模型发布,支持完全开源数据集 — const_reborn · 2026-08-24
- 英伟达 Nemotron 负责人:拟发布更强内部教师模型 — Dan_Jeffries1 · 2026-08-24
- Gemini 桌面版将支持头像,Gemini 4 筹备迹象显现 — testingcatalog · 2026-08-24
- dots3-note 模型发布:16B 活跃参数专注长程任务 — rohanpaul_ai · 2026-08-24