MiniMax 开源全模态视频模型 H3,支持原生 2K 立体声生成
赛博禅心 · wechat · 2026-08-03
MiniMax 正式开源新一代通用视频模型 MiniMax-H3。该模型是一个全模态生成系统,能够统一理解文本、图像、视频和音频输入,并生成最高 2K 分辨率、最长 15 秒且带有原生立体声音频的视频内容。
核心架构与能力
- H3-Base:核心为一个 33B 参数的单流 Transformer,联合预测视频与音频 latent。文本编码器复用了 Qwen3-VL-32B 的权重。
- H3-Context-IR:用于深度解析和提炼复杂多模态指令的预处理系统,将其转化为结构化表示以提升生成质量。
- H3-Regenerate-2K:摒弃传统超分模块,创新性地将 768p 生成结果连同原始上下文再次输入模型,通过上下文重生成实现 2K 超清输出。
部署与开源情况
模型支持文生视频、首尾帧生成以及多模态参考生成(Ref2VA,支持同时输入多张图片、多段音视频作为参考)。目前,H3-Base 权重已完全开放,支持 SGLang、vLLM、diffusers 和 ComfyUI 等主流框架本地部署,而 Context-IR 和 Regenerate-2K 模块则通过 API 形式提供以复现完整工作流。
所属事件:MiniMax 发布开源全模态模型 H3,支持原生 2K 音视频生成(14 条相关)→
「模型」频道最新
- 单 CPU 8GB 内存跑 2.78 万亿参数 Kimi K3 — Saboo_Shubham_ · 2026-08-03
- MiniMax-H3 开源权重限制美英欧盟等地访问 — tokenbender · 2026-08-03
- 生物科技从业者呼吁多用 DeepSeek 与 Qwen:查中文技术信息更好用 — MWCvitkovic · 2026-08-03
- tinygrad 预告本地部署新品,暗示 Qwen3.6-27B 即将发布 — max_paperclips · 2026-08-03
- 美国已非开源模型安全区?MiniMax 闭源引发行业担忧 — cocktailpeanut · 2026-08-03
- 传 Qwen3-Max 将开源,2.4T 参数比肩 Sonnet 且价格极低 — bindureddy · 2026-08-03