优化 Qwen 3.8 Flash Next:大显存下提升预填与生成速度

Jorlen · reddit · 2026-09-01

用户探讨在双 R9700 (64GB VRAM) + 32GB RAM 配置下运行 Qwen 3.8 Flash Next (Q4 量化) 的性能优化。当前预填速度约 180 t/s,生成 18 t/s。受限于 32GB 系统内存,无法将模型完全载入 RAM,需依赖 MMAP。用户已启用 flash-attn,并调整了 KV cache 类型和上下文大小,寻求进一步提速方案。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →