8 张 RTX 3090 跑 262K 上下文,Qwen3.8-Flash-Next 达 1200 tok/s
QuixiAI · x · 2026-09-06
Eric Hartford(QuixiAI,Dolphin/Samantha 作者)详细复盘了在 8 张五年前的 RTX 3090(共 192 GB 显存、无 FP8、无 NVLink)上以原生 262,144 token 上下文服务 Qwen3.8-Flash-Next 的全过程。该模型是 1250 亿参数的混合架构:Gated DeltaNet 线性注意力、Qwen Sparse Attention、四分支门控残差流、51 GB n-gram 嵌入表与内置投机 drafter,本是为数据中心 FP8 快速互联设计的。实测(精确 token 计量,1000 输入/2000 输出):
- 单并发:约 140 tok/s,中位延迟 14 秒
- 8 并发:聚合 590-600 tok/s
- 32 并发:峰值 1199.8 tok/s,单请求约 40 tok/s
关键优化包括用 512 GiB 锁页内存做二级 KV 缓存,被逐出 GPU 的会话可在 1 秒内恢复而无需重新 prefill。初版配置仅 409.7 tok/s 且用了会悄悄污染答案的量化 KV;最终方案净提速 2.9 倍,同时把上下文翻倍到原生上限并移除了量化。完整配置与数据已开源。
「Infra」频道最新
- 华尔街老兵算账:全球最大数据中心耗水仅相当于 3 座高尔夫球场 — rohanpaul_ai · 2026-09-06
- 日本披露 5500 亿美元对美投资协定进展,AI 与半导体将占「极重要」角色 — Polymarket · 2026-09-06
- QuixiAI 开源 SlimServe:配套 3090 集群推理方案的项目仓库 — QuixiAI · 2026-09-06
- T-Glass短缺加剧,Kinsus高端ABF月营收损失10-15% — zephyr_z9 · 2026-09-06
- 无凸点混合键合走向实用:Intel Diamond Rapids 率先落地,AMD Zen 传闻跟进 — bookwormengr · 2026-09-06
- Reddit 网友晒本地跑 AI 的硬件配置:大内存主机+轻终端远程访问 — Fun_Kangaroo512 · 2026-09-06