MiniMax 开源视频模型 H3:支持全模态输入,直出 2K 立体声
智东西 · wechat · 2026-08-03
MiniMax 正式开源新一代通用视频模型 MiniMax H3。该模型是一个全模态生成系统,能够统一理解文本、图像、视频和音频等多模态上下文,生成最长 15 秒、最高 2K 分辨率并带有原生立体声音频的视频。目前,H3 在 ArtificialAnalysis 有声视频编辑榜单中以 1130 分的 Elo 成绩位列第一。
H3 系统由三大模块构成:负责多模态指令理解和编排的 H3-Context-IR、负责实际音视频生成的 H3-Base,以及负责结合原始上下文重生成 2K 画面的 H3-Regenerate-2K。其中,H3-Base 模型权重已完全开源,并支持通过 vLLM、SGLang、ComfyUI 等主流框架部署,而另外两个高阶处理模块则需通过官方 API 调用。同步开源的还有华为昇腾、AMD、Intel 等 16 家国内外芯片与平台生态的适配支持。
所属事件:MiniMax 发布开源全模态模型 H3,主打原生音视频生成(33 条相关)→
「多模态」频道最新
- 绕过地域限制,开源 MCP 让 Claude 免费调用 Seedance 2.5 — matchaman11 · 2026-08-03
- Motion 发布 Claude 技能:输入链接一键生成视频 — EricBuess · 2026-08-03
- 实测 MiniMax H3 文生视频:生成内容被指过度审查 — DaLyon92x · 2026-08-03
- LoRA 训练实战求助:生成结果与采样图严重不符 — Kryimsson · 2026-08-03
- 海螺AI生成地铁洪水级运镜,单提示词干掉好莱坞剧组 — mhdfaran · 2026-08-03
- MiniMax H3 实测:短提示词无需改写即可出好图 — multimodalart · 2026-08-03