vLLM 联合英伟达优化,在 GB200 上实现 Qwen3.5 推理超 2.5 万 TPS

AccBalanced · x · 2026-08-08

vLLM 团队宣布,通过与 NVIDIA 团队的深度合作优化,在 GB200 NVL72 系统上运行 Qwen3.5 模型时,实现了单 GPU 超过 25,000 总 tokens/s 的吞吐量。

文章详细解析了针对 Qwen3.5 混合注意力架构(结合全注意力层与门控 Delta 网络 GDN 层)的优化难点。主要技术突破包括:

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →