单张 GH200 跑 NVFP4 精度实测:vLLM 推理性能基线分享
aaditya_ai · x · 2026-08-12
开发者分享了基于单张 NVIDIA GH200 480GB 的推理性能基线测试结果。
- 硬件与框架:使用 1 张 GH200,运行 vLLM 0.27.1 版本。
- 测试参数:采用 NVFP4 权重精度,强制输出 256 tokens/请求,温度设为 0,并取 3 次运行的中位数。
- 资源获取:推文附带了 NVIDIA AI 官方提供的 NVFP4 权重下载链接。
所属事件:单张GH200实测vLLM跑Nemotron破4600 tok/s(3 条相关)→
「Infra」频道最新
- 小米与宇树锁死全球快门传感器产能,冲击美国人形机器人量产 — Scobleizer · 2026-08-12
- YC S26 孵化项目 Kara:用超高纯度金刚石晶圆给 AI 芯片散热 — Scobleizer · 2026-08-12
- 逃避地球内卷:太空数据中心正成为 AI 算力新前沿 — DavidLinthicum · 2026-08-12
- 单张 GH200 跑出 3323 tok/s,开发者开放 Muse Glimmer 30B API — MaziyarPanahi · 2026-08-12
- 单卡 GH200 跑出 3323 tok/s 极限推理 — MaziyarPanahi · 2026-08-12
- 推理与智能体爆发:AI Token 消耗量半年激增 14 倍 — robleclerc · 2026-08-12