NVIDIA 实测 Cosmos 3 Super 视频生成服务:延迟与吞吐如何权衡

NVIDIA Developer · youtube · 2026-09-24

NVIDIA Developer 频道与 Nebius Physical AI 团队直播解析世界模型视频生成的服务化问题:与 LLM 不同,视频生成对延迟与吞吐的平衡要求截然不同。团队在 HGX B200 与 HGX H200 上通过 vLLM-Omni 对 NVIDIA Cosmos 3 Super 跑基准,比较四种服务拓扑(从单机 8 卡单副本到 8 个单卡副本),分析副本数、并行度与并发对请求延迟和「每节点每小时有效视频秒数」的影响。关键发现包括:更快的单请求响应可能意味着节点总产出更少;更多副本何时有帮助、额外并发何时反而增加延迟;以及做视频生成基准时哪些变量应保持恒定、如何校验生成视频的文件完整性与基本运动。基准可从 Nebius 开源仓库复现。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →