Qwen3.8-27B 单卡跑出 129.8 tok/s,vLLM 胜出

MaziyarPanahi · x · 2026-08-21

基准测试显示,Qwen3.8-27B BF16 在单张 NVIDIA GH200 上实现了 129.8 tok/s。配置包括 2048 输入 token 和 1536 强制输出 token。在单流场景下,vLLM + DFlash2 表现最佳,比普通自回归快 2.18 倍,比 MTP-3 快 9.4%。LambdaAPI 提供了算力支持。

所属事件:Qwen3.8-27B单张GH200跑出129.8 tok/s(2 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →