3090+16GB 内存跑 Qwen3-Next-80B,MoE 专家替换实现约 3 倍解码提速

Zestyclose_Reality15 · reddit · 2026-10-06

作者针对 MoE 卸载做了优化:Qwen3-Next-80B-A3B (Q4KM, 48.5GB) 在 RTX 3090 上只把 1/4 专家驻留显存,其余按需从 NVMe 读取。核心思路是「专家缺失替换」——等路由选中的不在显存的专家从 SSD 读入,还是用显存里次优专家顶替?全替换会明显劣化(模拟测试 +5.7% ppl),最终规则是只等路由 top-1 和 gate 权重 ≥0.15 的专家,其余替换,实测引擎内代价约 +1.2% ppl。结果:在约 15.7GB 显存下,解码速度从 stock llama.cpp(--n-cpu-moe 34)的 72.9/65.8/31.8 tok/s(充足/32GB/16GB 内存)提升到 108.4/97.8/94.5 tok/s;16GB 内存时纯 SSD 读取也有 89 tok/s。质量代价:ppl 高 1.6%,GSM8K 掉 1.8 分,HumanEval 无差异。限制:仅 Qwen3-Next、Linux+CUDA、单序列;16GB 场景是用锁内存模拟的。代码、脚本与原始日志和论文(含失败尝试)均已公开。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →