Qwen3.8 Flash Next 显存优化技巧:mmap 模式

Pyrolistical · reddit · 2026-08-30

分享在显存受限环境下运行 Qwen3.8-Flash-Next 模型的经验。默认的 load-mode auto 可能不会使用 mmap,导致 OOM。手动开启 tensor-read-lazy on 和 load-mode mmap 后,作者成功在 AMD 显卡上运行了 Q4 量化模型,并给出了具体的 llama-bench 命令与性能数据(279 t/s)。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →