NVIDIA 实测 Cosmos 3 Super 视频生成服务:延迟与吞吐如何权衡
NVIDIA Developer · youtube · 2026-09-24
NVIDIA Developer 频道与 Nebius Physical AI 团队直播解析世界模型视频生成的服务化问题:与 LLM 不同,视频生成对延迟与吞吐的平衡要求截然不同。团队在 HGX B200 与 HGX H200 上通过 vLLM-Omni 对 NVIDIA Cosmos 3 Super 跑基准,比较四种服务拓扑(从单机 8 卡单副本到 8 个单卡副本),分析副本数、并行度与并发对请求延迟和「每节点每小时有效视频秒数」的影响。关键发现包括:更快的单请求响应可能意味着节点总产出更少;更多副本何时有帮助、额外并发何时反而增加延迟;以及做视频生成基准时哪些变量应保持恒定、如何校验生成视频的文件完整性与基本运动。基准可从 Nebius 开源仓库复现。
「Infra」频道最新
- 高通宣布 X2 Elite 芯片将支持 Linux 系统 — karlfreund · 2026-09-24
- TPU 需求推高联发科增长预期至 65-85%,分析师称在美上市将暴涨 — BenBajarin · 2026-09-24
- Gas to GW 专家访谈中提及的公司进入 UBS 首选名单 — BenBajarin · 2026-09-24
- hf-mount-encrypted v0.12.0:Hugging Face 仓库可加密挂载为本地盘 — jedisct1 · 2026-09-24
- 用户实测:27B 本地模型能力已逼近个人需求天花板 — OvertaxedOne · 2026-09-24
- 单浏览器标签管理本地 AI:一个自建 GPU 控制面板 — W61k3r · 2026-09-24