Qwen3.8-27B单张GH200跑出129.8 tok/s
基准测试显示,Qwen3.8-27B(BF16)模型在单张NVIDIA GH200上实现了129.8 tokens/s的推理速度,测试采用vLLM框架配合DFlash2技术栈,配置为2048输入token和1536强制输出token。在对比中vLLM方案胜出,展示了大模型在单卡硬件上的高效推理表现。
2026-08-21 ~ 2026-08-21 · 2 条相关
- Qwen3.8-27B 在单张 GH200 上跑出 129.8 tok/s — MaziyarPanahi · 2026-08-21
另有 1 条近重复转述:MaziyarPanahi