5090本地跑Qwen3.8-Flash-Next:40tok/s且几乎不占内存
nirurin · reddit · 2026-09-25
作者在 5090(32GB 显存)+ 64GB 内存的机器上,用 llama.cpp 跑 Qwen3.8-Flash-Next 的 Atomic 量化版(Q4KM,33 个 GGUF 分片),发现一个意外现象:模型几乎不使用系统内存。他用 --load-mode mmap --lazy-mode on --fit off --gpu-layers all --n-cpu-moe 32 --ctx-size 64768 --flash-attn on 的组合,最终只用约 27GB 显存、8GB 系统内存,decode 速度 40 tok/s、prompt processing 约 50 tok/s。他原以为不放进显存的部分会缓存到内存,结果似乎直接从 NVME SSD 读取,速度却比预期(以为只有 10 tok/s)好得多,并询问这是否正常、是否还有优化空间。
「Infra」频道最新
- 免校准量化方法 TQ 开源:4-bit 量化 Qwen3.8-27B 即发即用 — textclf · 2026-09-25
- Ben Bajarin:Agent 推理重塑数据中心 CPU/GPU 配比,neocloud 落后 hyperscaler — BenBajarin · 2026-09-25
- PreFT 论文入选 NeurIPS:仅 Prefill 阶段用 LoRA,多适配器推理提速 — aryaman2020 · 2026-09-25
- 网友晒 32 GPU 本地 AI 主板,评论区想塞进自家壁橱 — TheZachMueller · 2026-09-25
- 《现代微处理器 90 分钟指南》:系统/性能工程师的速成经典 — blaizedsouza · 2026-09-25
- GPU 成新资产类别:H100 一年回报 +76%,B300 租金指数涨 66% — KyeGomezB · 2026-09-25