单张 GH200 实测:vLLM 搭载 NVFP4 运行大模型性能表现
llm_wizard · x · 2026-08-12
开发者分享了基于 Lambda Labs 单张 GH200 (480GB) 的推理性能测试结果。
测试环境采用 vLLM 0.27.1 版本,开启了 NVFP4 权重,强制输出 256 个 token,温度设为 0,并取 3 次运行的中位数。推文同时提供了 NVIDIA AI 官方 NVFP4 权重的下载链接。
所属事件:单张GH200实测vLLM跑Nemotron破4600 tok/s(3 条相关)→
「Infra」频道最新
- macOS虚拟化突破:Apple Silicon跑大模型速度暴增超10倍 — Scobleizer · 2026-08-12
- 小米与宇树锁死全球快门传感器产能,冲击美国人形机器人量产 — Scobleizer · 2026-08-12
- YC S26 孵化项目 Kara:用超高纯度金刚石晶圆给 AI 芯片散热 — Scobleizer · 2026-08-12
- 逃避地球内卷:太空数据中心正成为 AI 算力新前沿 — DavidLinthicum · 2026-08-12
- 单张 GH200 跑出 3323 tok/s,开发者开放 Muse Glimmer 30B API — MaziyarPanahi · 2026-08-12
- 单卡 GH200 跑出 3323 tok/s 极限推理 — MaziyarPanahi · 2026-08-12