5090本地跑Qwen3.8-Flash-Next:40tok/s且几乎不占内存

nirurin · reddit · 2026-09-25

作者在 5090(32GB 显存)+ 64GB 内存的机器上,用 llama.cpp 跑 Qwen3.8-Flash-Next 的 Atomic 量化版(Q4KM,33 个 GGUF 分片),发现一个意外现象:模型几乎不使用系统内存。他用 --load-mode mmap --lazy-mode on --fit off --gpu-layers all --n-cpu-moe 32 --ctx-size 64768 --flash-attn on 的组合,最终只用约 27GB 显存、8GB 系统内存,decode 速度 40 tok/s、prompt processing 约 50 tok/s。他原以为不放进显存的部分会缓存到内存,结果似乎直接从 NVME SSD 读取,速度却比预期(以为只有 10 tok/s)好得多,并询问这是否正常、是否还有优化空间。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →