Qwen3.8-27B 在单张 GH200 上跑出 129.8 tok/s

MaziyarPanahi · x · 2026-08-21

Qwen3.8-27B (BF16) 模型在单张 NVIDIA GH200 上实现了 129.8 tokens/s 的推理速度。测试采用 vLLM 框架配合 DFlash2 技术栈:在单流请求场景下,该组合比普通自回归推理快 2.18 倍,比 MTP-3 快 9.4%。

所属事件:Qwen3.8-27B 单张 GH200 跑出 129.8 tok/s(3 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →