8 张 RTX 3090 跑 262K 上下文,Qwen3.8-Flash-Next 达 1200 tok/s

QuixiAI · x · 2026-09-06

Eric Hartford(QuixiAI,Dolphin/Samantha 作者)详细复盘了在 8 张五年前的 RTX 3090(共 192 GB 显存、无 FP8、无 NVLink)上以原生 262,144 token 上下文服务 Qwen3.8-Flash-Next 的全过程。该模型是 1250 亿参数的混合架构:Gated DeltaNet 线性注意力、Qwen Sparse Attention、四分支门控残差流、51 GB n-gram 嵌入表与内置投机 drafter,本是为数据中心 FP8 快速互联设计的。实测(精确 token 计量,1000 输入/2000 输出):

关键优化包括用 512 GiB 锁页内存做二级 KV 缓存,被逐出 GPU 的会话可在 1 秒内恢复而无需重新 prefill。初版配置仅 409.7 tok/s 且用了会悄悄污染答案的量化 KV;最终方案净提速 2.9 倍,同时把上下文翻倍到原生上限并移除了量化。完整配置与数据已开源。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →