16GB 显存跑通 Qwen 3.8 Flash Next 130k 上下文,速率 15-20 t/s

AvidCyclist250 · reddit · 2026-09-24

作者在一周测试后分享了在 4080(16GB VRAM)+ 64GB RAM 上跑 Qwen 3.8 Flash Next 的完整配置,在 130k 上下文下达到 15-20 t/s。

他强调四个常被忽略的关键点:选对量化(AtomicChat AD-4.27bpw / Q4KM 目标)、选对模型(含共享的 Unsloth MTP 头)、选对分支(用其 pr-mtp-fix 分支,需 llama.cpp PR #28243 加一个修复 commit,master 尚不能加载该 MTP 头)、选对缓存参数(q8 KV cache)。

核心技巧是 --spec-draft-cpu-moe:把投机解码的 draft experts 放进内存,让目标模型的热点 experts 留在 GPU 上。相比 IQ4XS 的约 10 t/s,这套配置在 131k 上下文下达到 16.5 t/s 生成 / 350 t/s 预填充。配置细节见 GitHub 仓库。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →