Qwen3.8-27B单张GH200跑出129.8 tok/s

基准测试显示,Qwen3.8-27B(BF16)模型在单张NVIDIA GH200上实现了129.8 tokens/s的推理速度,测试采用vLLM框架配合DFlash2技术栈,配置为2048输入token和1536强制输出token。在对比中vLLM方案胜出,展示了大模型在单卡硬件上的高效推理表现。

2026-08-21 ~ 2026-08-21 · 2 条相关

另有 1 条近重复转述:MaziyarPanahi