vLLM-Omni实测MiniMax H3:八卡B300生成10秒MP4仅耗时8.7秒
机器之心 · wechat · 2026-09-13
vLLM-Omni 团队详解了 MiniMax H3 音视频联合生成模型的服务级优化。H3 的推理链路包含 Qwen3-VL 编码器、音视频联合 DiT、独立 VAE、跨进程传输与 H.264/AAC 封装,只优化 DiT 不够,需要全流水线系统优化。在八卡 B300 上,FastH3 将 49 次 DiT 前向压缩到 4 次,生成一个 10.125 秒的完整 MP4 仅需 8.6788.710 秒,达到完整响应的实时(RTF≤1)。
基础线用无损优化:vLLM-Omni 通过 TRTLLMATTN、FastUlysses 对称内存通信、融合 DiT 算子(RMSNorm+RoPE、SwiGLU)、八卡并行 VAE 解码和 GPU 端直出 uint8 帧等手段,相对 Diffusers 降低 30.8% 时延(1.445 倍加速)。文章还给出扩展路径:分布式逐层卸载(DLO)可降 37.5% HBM、在线 FP8 量化峰值显存降 38.9%、SAGE+Skip-Softmax 注意力加速 1.237 倍等,并严格区分了无损优化与有损加速两条证据线。
「Infra」频道最新
- 深度长文拆解光纤-芯片耦合:单点指标好看不等于好产品 — jwt0625 · 2026-09-13
- GPU 利用率 100% 也会骗人:一份 42 页手册讲透 SM 与显存性能真相 — techNmak · 2026-09-13
- 五角大楼拟向 Fluidstack 提供 50 亿美元 AI 基建贷款 — VraserX · 2026-09-13
- AMD 反超高通,跻身全球第三大无晶圆厂芯片公司 — xiaosun86 · 2026-09-13
- 一个月冒出 5 个专用推理引擎,vLLM 核心成员驳「碎片化」质疑 — AccBalanced · 2026-09-13
- 二十年算力老兵驳 Dario「给前沿踩刹车」:算力不会闲置,只会改道 — basedjensen · 2026-09-13