MiniMax 开源全模态视频模型 H3,支持原生 2K 立体声生成

赛博禅心 · wechat · 2026-08-03

MiniMax 正式开源新一代通用视频模型 MiniMax-H3。该模型是一个全模态生成系统,能够统一理解文本、图像、视频和音频输入,并生成最高 2K 分辨率、最长 15 秒且带有原生立体声音频的视频内容。

核心架构与能力

部署与开源情况

模型支持文生视频、首尾帧生成以及多模态参考生成(Ref2VA,支持同时输入多张图片、多段音视频作为参考)。目前,H3-Base 权重已完全开放,支持 SGLang、vLLM、diffusers 和 ComfyUI 等主流框架本地部署,而 Context-IR 和 Regenerate-2K 模块则通过 API 形式提供以复现完整工作流。

所属事件:MiniMax 发布开源全模态模型 H3,支持原生 2K 音视频生成(14 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →