SlimWise 解耦 MoE 前后阶段专家剪枝,解码吞吐最高提升 1.81 倍
Gunho Park · hf · 2026-10-07
- 问题:MoE 模型每 token 只激活少量专家,但批式解码几乎会触及全部专家池,专家权重搬运成为主要瓶颈;传统剪枝连计算受限的 prefill 一起剪,牺牲质量却收益甚微。
- 方案:SlimWise 按推理阶段裁剪专家池——prefill 用全模型,decode 用剪枝后模型,并直接复用 prefill 生成的 KV cache 免转换;另加低成本的蒸馏阶段,只更新少量参数让 decoder 能从全模型 KV cache 继续。
- 实现:已落地 vLLM,支持 PD 分离与 PD 共置部署。
- 效果:在 Qwen3.6-35B-A3B 上,50% 专家剪枝下解码吞吐最高提升 1.81 倍,精度损失极小;并指出基准分数可能掩盖剪枝导致的生成长度失真。
「Infra」频道最新
- 为什么 2019 款 Mac Pro 才是本地 LLM 的理想机器 — Odd-Capital-847 · 2026-10-07
- RL 训练团队爆料:1T 全量权重同步低于 5 秒 — saurabh_shah2 · 2026-10-07
- NVIDIA 发布 UNREAL:一个模型统一语料检索与 128K 长上下文 — nvidia · 2026-10-07
- Ora 扫描 10 万+网站:仅 5% 对 AI Agent 友好,平均分 41 — EdenEmarco177 · 2026-10-07
- 重训 DFlash 2 草稿模型,27B 三值模型 L4 提速 2.2 倍 — naklitechie · 2026-10-07
- 独立开发者吐槽 Together AI 限流:多 Agent 并行测试寸步难行 — Correct_Positive_108 · 2026-10-07