vLLM 联合 MiniMax 发布 H3 模型,支持原生音视频同步生成
vllm_project · x · 2026-08-03
vLLM 项目与 MiniMax 团队合作,推出了开源多模态生成模型 MiniMax-H3 的部署方案。
- 核心能力:模型能够读取文本、图像、视频和音频的混合上下文,端到端生成连贯的视听内容,而非后期配音。
- 架构设计:采用 CFG 蒸馏的联合视频/音频扩散 Transformer (DiT),通过 vLLM-Omni 的 OpenAI 兼容 API 提供服务,每次请求直接返回包含 H.264 视频和原生立体声音频的 MP4 文件。
- 性能表现:在 4×B300 GPU 上,仅需约 87 秒即可生成 8.7 秒、1248×768 分辨率的同步音视频。
- 部署方式:模型分为 FL2VA(文本/首尾帧生成)和 Ref2VA(多模态参考生成)两个独立分区,切换时需重启服务。
所属事件:MiniMax 发布开源全模态模型 H3,支持原生 2K 音视频生成(14 条相关)→
「Infra」频道最新
- 传 Google TPU 需求激增,2028 年预计达 1500 万颗 — SumitGup · 2026-08-03
- 单 CPU 8GB 内存跑 2.78 万亿参数 Kimi K3 — Saboo_Shubham_ · 2026-08-03
- tinygrad 预告本地部署新品,暗示 Qwen3.6-27B 即将发布 — max_paperclips · 2026-08-03
- 单节点吞吐量达 952 tok/s,AMD MI355X 跑赢英伟达 B200 — adrianscottcom · 2026-08-03
- Qwen3.8-27B即将开源,17GB内存即可本地运行 — danielhanchen · 2026-08-03
- AirLLM突破显存瓶颈:4GB显存单卡跑70B大模型 — techNmak · 2026-08-03