NVIDIA 用 4.5 小时把 MiniMax H3 加速 3.95 倍
songhan_mit · x · 2026-08-04
NVIDIA 介绍了对 MiniMax H3 的视频推理加速:只用 4.5 小时优化,就把端到端耗时压到原来的 3.95×。
- MiniMax H3 被描述为一个 33B 的统一多模态生成模型,把文本、图片、视频和音频放进同一上下文,直接生成带原生立体声音轨的短视频片段。
- Sol Video Inference Engine 在 8× GB200 上实现加速,测试条件为 1344×768、24 fps、124 帧。
- 加速手段包括 kernel fusion、graph capture、跨步缓存、稀疏注意力,并且 没有蒸馏、微调、LoRA 或离线校准。
- 这篇文章更像是一套面向开源视频模型的“上线即优化”方案。
「Infra」频道最新
- On Semiconductor 盈利超预期,称 2026 年 AI 数据中心收入将翻倍以上 — Polymarket · 2026-08-04
- 核能初创公司 Valar 获红杉领投 10 亿美元融资 — kleffew94 · 2026-08-04
- 2025 图表显示,AI API 收入仍远落后于云厂商 capex — SurpriseDog9000 · 2026-08-04
- 美国中部对 AI 数据中心的反弹正在升温 — altryne · 2026-08-04
- 半导体和数据中心的扩张,远慢于 AI 需求 — robleclerc · 2026-08-04
- Gemma 4 31B 的 KV Cache 内存开销比 DeepSeek V4 Flash 高 13 倍 — teortaxesTex · 2026-08-04