RTX 3060+16GB 内存跑 68GB Qwen MoE 提速 10-15 倍,输出比特级一致

zyxciss · reddit · 2026-10-10

作者在 llama.cpp 内实现了 --moe-direct-io 功能,让 RTX 3060 12GB + 16GB DDR4 的低配机器以 20-21 tok/s(热缓存 24+)运行 68GB 的 Qwen 3.8 Flash Next(125B MoE、512 专家、top-10 路由)IQ2XS 量化模型,比原版 llama.cpp 的 1.4-2.1 tok/s 快 10-15 倍。

关键点:

对低内存本地部署大 MoE 模型是实打实的突破。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →