单张GH200实测vLLM跑Nemotron破4600 tok/s
近日开发者基于单张 NVIDIA GH200 (480GB) 显卡,对大模型推理性能进行了极限并发基线测试。测试采用 vLLM 0.27.1 框架并开启 NVFP4 权重精度,运行 Nemotron 3.5 Lightning 模型(30B-A3B NVFP4 检查点)。实测结果显示,在强制输出并跑满 64 个并发的极致条件下,该单卡推理速度成功突破 4600 tok/s,充分展现了 GH200 结合 vLLM 框架在低精度大模型部署上的卓越性能表现。
2026-08-12 ~ 2026-08-12 · 3 条相关
- 单张 GH200 实测:vLLM 搭载 NVFP4 运行大模型性能表现 — llm_wizard · 2026-08-12
- 单张 GH200 跑 64 个并发,Nemotron 3.5 速度破 4600 tok/s — pcuenq · 2026-08-12
另有 1 条近重复转述:aaditya_ai