llama.cpp mmap 实测:16G+64G 内存跑 Qwen3.8-Flash-Next 达 26t/s

q8019222 · reddit · 2026-08-28

Reddit 用户分享用 llama.cpp 的 mmap 功能,把 Qwen3.8-Flash-Next(IQ3XSS 量化)装进 16G 内存+64G 交换空间的机器运行,速度仍能达到 26 tokens/s。作为对比,同机器上跑非 MoE 的 30B 模型只有约 10 tokens/s。mmap 让内存不足时按需加载权重,是低成本跑大 MoE 模型的实用技巧。

所属事件:llama.cpp 实测:低内存与双卡跑 Qwen 新模型提速(2 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →