单张 GH200 跑 64 个并发,Nemotron 3.5 速度破 4600 tok/s

pcuenq · x · 2026-08-12

开发者在单张 NVIDIA GH200 上对 Nemotron 3.5 Lightning 模型(30B-A3B NVFP4 检查点)进行了极致并发测试。

使用 vLLM 0.27.1 部署时,单流推理速度达到 315 tok/s;而在 64 路同时生成的并发场景下,总吞吐量更是飙升至 4,694 tok/s。这意味着在单张 GPU 上同时启动数十个 AI 智能体已成为现实,大幅降低了高并发智能体的硬件门槛。

所属事件:单张GH200实测vLLM跑Nemotron破4600 tok/s(3 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →