3 张 3090 跑 1M 上下文:Qwen3.8-Flash-Next 的 KV cache 可卸载到内存

sadnessdevil · reddit · 2026-09-16

作者展示了一个实用技巧:基于 qwen4exp 架构的 Qwen3.8-Flash-Next 可以把大部分 KV cache 放到系统内存,几乎不损失解码速度,并用补丁在 vLLM 上实现了 3 张 3090 跑满 1M 上下文。

实测性能:短上下文约 80 tok/s,QSA 达到 2048 token 预算后降至约 60 tok/s,之后随上下文增长保持平稳;4 并发约 150 tok/s;248k 处 prefill 达 3701 tok/s。补丁和模型已放在其 Hugging Face 主页。

原理:解码速度本质是带宽问题。普通模型的全注意力层每步要读全部 KV cache,262k 上下文下 12 层每步要读 6GiB,PCIe 4.0 x16(约 32GiB/s)只够 5 tok/s。而 Flash-Next 中:48 层里只有 12 层有 KV cache,其余 36 层是固定大小状态的 gated delta net;这 12 层的 QSA 索引器每层最多只选 2048 个位置,每 token 每层仅读 4MiB、12 层共 48MiB——读量由索引预算而非上下文长度决定,约 3.9GB/s 即可支撑 80 tok/s。GPU 上只需保留模型权重、每 token 每层 66B 的槽位与池化索引键。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →