NVIDIA 四张 B200 跑 Nemotron 3 Ultra,优化后并发用户提升 2.5 倍
NVIDIAAI · x · 2026-09-15
- NVIDIA 工程团队发布 Nemotron 3 Ultra NIM 的全栈推理优化详解:在 4 张 B200 GPU 上,相比未优化的基线 serving 栈,系统吞吐最高提升 2.5 倍,在每用户 50 TPS 的交互目标下达到 1997 tokens/s 的总吞吐。
- 优化手段包括:自动调优 kernel、张量并行、前缀与状态复用、调度器与显存调优、MTP 投机解码等。
- NIM 将模型与 GPU 感知的服务配置打包为可部署微服务,并提供 NVIDIA AIPerf 基准工具,方便开发者用真实流量回放选择满足延迟 SLO 的 Pareto 最优点。
「Infra」频道最新
- 史上最大芯片支出潮在即,恐慌抛售 AI 芯片股是误判? — firstadopter · 2026-09-15
- 矿卡 CMP 170HX 刷 64GB 显存、1.49TB/s 带宽,改装实测启动 — _Boffin_ · 2026-09-15
- 本地跑模型到底花多少电费?开发者给 harness 加了成本计算器 — giveen · 2026-09-15
- Hugging Face 团队梳理:哪些开源 LLM 最适合端侧推理 — NielsRogge · 2026-09-15
- 纯 C99 单引擎同时跑 BitNet 与 GGUF,Xeon 上 36 tok/s — shifu_legend · 2026-09-15
- 开发者求助:用 ChatGPT 订阅 OAuth 顶替 API 做生产应用可行吗 — builtforoutput · 2026-09-15