3 张 3090 跑 1M 上下文:Qwen3.8-Flash-Next 的 KV cache 可卸载到内存
sadnessdevil · reddit · 2026-09-16
作者展示了一个实用技巧:基于 qwen4exp 架构的 Qwen3.8-Flash-Next 可以把大部分 KV cache 放到系统内存,几乎不损失解码速度,并用补丁在 vLLM 上实现了 3 张 3090 跑满 1M 上下文。
实测性能:短上下文约 80 tok/s,QSA 达到 2048 token 预算后降至约 60 tok/s,之后随上下文增长保持平稳;4 并发约 150 tok/s;248k 处 prefill 达 3701 tok/s。补丁和模型已放在其 Hugging Face 主页。
原理:解码速度本质是带宽问题。普通模型的全注意力层每步要读全部 KV cache,262k 上下文下 12 层每步要读 6GiB,PCIe 4.0 x16(约 32GiB/s)只够 5 tok/s。而 Flash-Next 中:48 层里只有 12 层有 KV cache,其余 36 层是固定大小状态的 gated delta net;这 12 层的 QSA 索引器每层最多只选 2048 个位置,每 token 每层仅读 4MiB、12 层共 48MiB——读量由索引预算而非上下文长度决定,约 3.9GB/s 即可支撑 80 tok/s。GPU 上只需保留模型权重、每 token 每层 66B 的槽位与池化索引键。
「Infra」频道最新
- 曝苹果拟用 M8 芯片造 AI 服务器,或借英伟达 NVLink 重返服务器市场 — gappyvalley · 2026-09-16
- uv 0.12.9 改 ZIP 解包策略,冷缓存 Python 安装显著提速 — KhuyenTran16 · 2026-09-16
- 曝苹果自研芯片打造企业级 AI 服务器,最早 2026 年落地 — Polymarket · 2026-09-16
- 花旗分析师:HBM 需求 2027 年将暴增 62%,2028 年再增 69% — TiernanRayTech · 2026-09-16
- antirez 开源 DwarfStar 融合内核库,MIT 许可随便拿去用 — antirez · 2026-09-16
- 手里 A30/A40 加新购 48GB Pro5000,这堆 GPU 怎么用好? — OvertaxedOne · 2026-09-16