llama.cpp mmap 实测:16G+64G 内存跑 Qwen3.8-Flash-Next 达 26t/s
q8019222 · reddit · 2026-08-28
Reddit 用户分享用 llama.cpp 的 mmap 功能,把 Qwen3.8-Flash-Next(IQ3XSS 量化)装进 16G 内存+64G 交换空间的机器运行,速度仍能达到 26 tokens/s。作为对比,同机器上跑非 MoE 的 30B 模型只有约 10 tokens/s。mmap 让内存不足时按需加载权重,是低成本跑大 MoE 模型的实用技巧。
所属事件:llama.cpp 实测:低内存与双卡跑 Qwen 新模型提速(2 条相关)→
「Infra」频道最新
- RTX 3090 实测 Qwen3.8-Flash:量化策略与性能调优 — crusaderky · 2026-08-28
- Gemini 1.5 Flash 推理速度实测或超 300 tok/s — Sentdex · 2026-08-28
- 论文解析 NVSHMEM:GPU 通信的系统级分析 — thoefler · 2026-08-28
- Inferact 发布 GLM-5.3 NVFP4 版本,显存占用降 38% — vllm_project · 2026-08-28
- NVIDIA Warp 下载量破 1000 万,加速 Python 物理模拟 — NVIDIAAI · 2026-08-28
- 生产环境 LLM 网关架构:权衡与踩坑实录 — AI Engineer · 2026-08-28