RTX 3060+16GB 内存跑 68GB Qwen MoE 提速 10-15 倍,输出比特级一致
zyxciss · reddit · 2026-10-10
作者在 llama.cpp 内实现了 --moe-direct-io 功能,让 RTX 3060 12GB + 16GB DDR4 的低配机器以 20-21 tok/s(热缓存 24+)运行 68GB 的 Qwen 3.8 Flash Next(125B MoE、512 专家、top-10 路由)IQ2XS 量化模型,比原版 llama.cpp 的 1.4-2.1 tok/s 快 10-15 倍。
关键点:
- 不再走捷径:作者两个月前试过预测下一 token 会用到的 MoE 专家来加速 CPU/GPU 卸载,但当时靠剪掉冷门专家换速度,损害输出质量,遂弃坑;
- 痛点:16GB 内存跑 68GB 模型,原版每 token 触发 1100-1500 次缺页、从 SSD 拉 200-300MB;Strata 等方案需要 mlock 固定 24GiB 专家,小内存机器直接 OOM;
- 新做法:--moe-direct-io + 顺序预取,把每 token 缺页降到约 0(32 个 token 仅 +1),且输出与原版比特级一致,不牺牲任何专家和质量。
对低内存本地部署大 MoE 模型是实打实的突破。
「Infra」频道最新
- SGLang-Diffusion 扩散模型推理框架将亮相 PyTorch 大会 — PyTorch · 2026-10-10
- 吴恩达:我的一个 agent 一天发起 5000–10000 次网页搜索,数据中心远远不够 — DeepLearningAI · 2026-10-10
- SGLang Summit 2026 议程公布:Intel/OpenAI/Perplexity 高管齐聚 SF — ying11231 · 2026-10-10
- AI 推理市场明年或从 1600 亿增至 3500 亿美元,软件毛利将承压 — Sethwinterroth · 2026-10-10
- Nebius 净债务仅 0.2 倍营收,远优于 CoreWeave 的 2.9 倍 — Beth_Kindig · 2026-10-10
- Devon Eriksen 用「一罐重元素」类比讲解先进芯片制造的资源门槛 — Yamapama · 2026-10-10