vLLM 联合英伟达优化,在 GB200 上实现 Qwen3.5 推理超 2.5 万 TPS
AccBalanced · x · 2026-08-08
vLLM 团队宣布,通过与 NVIDIA 团队的深度合作优化,在 GB200 NVL72 系统上运行 Qwen3.5 模型时,实现了单 GPU 超过 25,000 总 tokens/s 的吞吐量。
文章详细解析了针对 Qwen3.5 混合注意力架构(结合全注意力层与门控 Delta 网络 GDN 层)的优化难点。主要技术突破包括:
- Blackwell 架构优化的 GDN Prefill 内核:相比之前的 FLA/Triton 实现,新内核在不同模型大小和批次形状下实现了 1.02 倍至 5.78 倍的性能提升。
- 分离式推理(P/D serving)状态转移:解决了在预填充和解码工作节点之间正确转移异构注意力与 GDN 状态的挑战。
「Infra」频道最新
- RTX 5090 跑 Qwen 3.6 27B 实测:262k 上下文速度达 40 t/s — Gargle-Loaf-Spunk · 2026-08-08
- Red Hat 发布 DSpark 新模型,vLLM 推理速度飙升 4 倍 — vllm_project · 2026-08-08
- Together AI 发布交互式图表,图解大模型量化与推理原理 — zainhas · 2026-08-08
- Nscale 传 IPO 前宣称获 510 亿美元合同收入,遭业内质疑 — nathanbenaich · 2026-08-08
- Baseten 推理工程大师课:如何将大模型权重转化为生产级应用 — yenkel · 2026-08-08
- 预测称十年后谷歌将转型为以TPU为主的算力芯片企业 — BorisMPower · 2026-08-08