单张 GH200 跑 64 个并发,Nemotron 3.5 速度破 4600 tok/s
pcuenq · x · 2026-08-12
开发者在单张 NVIDIA GH200 上对 Nemotron 3.5 Lightning 模型(30B-A3B NVFP4 检查点)进行了极致并发测试。
使用 vLLM 0.27.1 部署时,单流推理速度达到 315 tok/s;而在 64 路同时生成的并发场景下,总吞吐量更是飙升至 4,694 tok/s。这意味着在单张 GPU 上同时启动数十个 AI 智能体已成为现实,大幅降低了高并发智能体的硬件门槛。
所属事件:单张GH200实测vLLM跑Nemotron破4600 tok/s(3 条相关)→
「Infra」频道最新
- 低显存跑 MiniMax H3 烧毁显卡?用户实测翻车警告 — ROBOTTTTT13 · 2026-08-12
- StarCloud 探索太空数据中心:将 AI 硬件送入轨道 — DavidLinthicum · 2026-08-12
- gakonst 为 nanocodex 添加机密计算支持,实现可验证的机密 AI — AccBalanced · 2026-08-12
- 阿里云 CUBE 5.0 模块化设计:100 天建成 AI 数据中心并降本 10% — rohanpaul_ai · 2026-08-12
- CoreWeave 获 26 亿美元信贷,押注英伟达 GPU 长期价值 — OnlineInference · 2026-08-12
- poolside 举办 Laguna 模型加速赛,社区将其推理速度提升 2.6 倍 — gajesh · 2026-08-12