双卡极限优化:MiniMax-H3 视频生成提速 8 倍
multimodalart · x · 2026-08-10
开发者分享了在 Diffusers 框架下大幅加速 MiniMax-H3(33B 视频与音频同步生成模型)的工程实践。通过双卡(48GB+20GB)部署,实现了单张图片生成 9.7 秒、5 秒视频及音频生成 44.2 秒的成绩,相比基础配置分别提速 16 倍和 8 倍。
核心优化思路并非单纯加速去噪,而是削减模型频繁加载与释放带来的「固定开销」:
- 将量化后的 text encoder 缓存至磁盘
- 将 text encoder 常驻于第二张 20GB 显卡
- 让 transformer 在解码期间保持常驻(通过 VAE fp16 化平衡显存)
此外,项目还支持了首尾帧指定、参照图生成、批量生成等功能,并已在 GitHub 开源。
「Infra」频道最新
- 解析拖慢 AI 应用的 7 大工程瓶颈 — goyalshaliniuk · 2026-08-10
- 传英伟达认证 300mW 激光并买断大部分供应 — zephyr_z9 · 2026-08-10
- PyTorch 深度解析:为什么不应释放 Pinned Memory — ezyang · 2026-08-10
- Rust 线性代数库编译至 Wasm,实现浏览器端 6 倍性能提升 — doodlestein · 2026-08-10
- 法国 10GW 电力盈余若用于 AI 数据中心可年入 3500 亿欧元 — emmanuelvivier · 2026-08-10
- 无CUDA经验靠编程智能体拿下GPU优化赛第五 — tokenbender · 2026-08-10