单张GH200实测vLLM跑Nemotron破4600 tok/s

近日开发者基于单张 NVIDIA GH200 (480GB) 显卡,对大模型推理性能进行了极限并发基线测试。测试采用 vLLM 0.27.1 框架并开启 NVFP4 权重精度,运行 Nemotron 3.5 Lightning 模型(30B-A3B NVFP4 检查点)。实测结果显示,在强制输出并跑满 64 个并发的极致条件下,该单卡推理速度成功突破 4600 tok/s,充分展现了 GH200 结合 vLLM 框架在低精度大模型部署上的卓越性能表现。

2026-08-12 ~ 2026-08-12 · 3 条相关

另有 1 条近重复转述:aaditya_ai