单张 GH200 实测:vLLM 搭载 NVFP4 运行大模型性能表现

llm_wizard · x · 2026-08-12

开发者分享了基于 Lambda Labs 单张 GH200 (480GB) 的推理性能测试结果。

测试环境采用 vLLM 0.27.1 版本,开启了 NVFP4 权重,强制输出 256 个 token,温度设为 0,并取 3 次运行的中位数。推文同时提供了 NVIDIA AI 官方 NVFP4 权重的下载链接。

所属事件:单张GH200实测vLLM跑Nemotron破4600 tok/s(3 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →