3090+16GB 内存跑 Qwen3-Next-80B,MoE 专家替换实现约 3 倍解码提速
Zestyclose_Reality15 · reddit · 2026-10-06
作者针对 MoE 卸载做了优化:Qwen3-Next-80B-A3B (Q4KM, 48.5GB) 在 RTX 3090 上只把 1/4 专家驻留显存,其余按需从 NVMe 读取。核心思路是「专家缺失替换」——等路由选中的不在显存的专家从 SSD 读入,还是用显存里次优专家顶替?全替换会明显劣化(模拟测试 +5.7% ppl),最终规则是只等路由 top-1 和 gate 权重 ≥0.15 的专家,其余替换,实测引擎内代价约 +1.2% ppl。结果:在约 15.7GB 显存下,解码速度从 stock llama.cpp(--n-cpu-moe 34)的 72.9/65.8/31.8 tok/s(充足/32GB/16GB 内存)提升到 108.4/97.8/94.5 tok/s;16GB 内存时纯 SSD 读取也有 89 tok/s。质量代价:ppl 高 1.6%,GSM8K 掉 1.8 分,HumanEval 无差异。限制:仅 Qwen3-Next、Linux+CUDA、单序列;16GB 场景是用锁内存模拟的。代码、脚本与原始日志和论文(含失败尝试)均已公开。
「Infra」频道最新
- NVIDIA 报告:89% 电信运营商将开源模型纳入 AI 战略 — nordicinst · 2026-10-06
- 用 vLLM 补丁在 DGX Spark 上实测:DiffusionGemma 打平并跑赢商用 API — vllm_project · 2026-10-06
- Cloudflare 推出 agent 优先的 CLI 工具 cf,八项举措打破可观测性黑箱 — dinasaur_404 · 2026-10-06
- 128GB Mac Studio 跑本地 Agent 栈怎么选:推理层之争引发讨论 — DrainBramage · 2026-10-06
- Polars 2.0 发布:流式引擎成默认,SQL 升为一等公民 — banteg · 2026-10-06
- HBM 砍单传闻下 Disco 成热门做空标的,空头警告风险 — zephyr_z9 · 2026-10-06