MiniMax 开源全模态视频模型 H3:支持原生立体声与 2K 画质
MiniMax 稀宇科技 · wechat · 2026-08-03
MiniMax 正式开源新一代通用视频模型 MiniMax-H3。该模型是一个全模态生成系统,能够统一理解文本、图像、视频和音频构成的多模态上下文,并生成最高 2K 分辨率、最长 15 秒、带有原生立体声音频的视频。
核心架构与功能亮点:
- 多模态输入:支持纯文本、首尾帧图像,以及最多 12 个混合多模态参考素材(图/视频/音频),实现人物身份保留、嘴型编辑和音色参考等复杂任务。
- 系统设计:完整系统包含 H3-Context-IR(多模态指令预处理编排)、H3-Base(768p 基础音视频生成)和 H3-Regenerate-2K(基于上下文的 2K 超分重生成)三个模块。
- 底层架构:H3-Base 采用 33B 参数的单流 Omni-Transformer,结合 Qwen3-VL-32B 作为文本与视觉编码器,并原生支持稀疏注意力(后续更新开源)以降低长序列计算开销。
部署与开源情况:
目前 H3-Base 的模型权重已完全开放,支持 SGLang、vLLM、diffusers 和 ComfyUI 等主流框架进行本地部署。Context-IR 与 2K 重生成模块暂未开源,但官方提供了 API 和完整的端到端工作流供开发者验证与复现。
所属事件:MiniMax 发布开源全模态模型 H3,支持原生 2K 音视频生成(14 条相关)→
「模型」频道最新
- 单 CPU 8GB 内存跑 2.78 万亿参数 Kimi K3 — Saboo_Shubham_ · 2026-08-03
- MiniMax-H3 开源权重限制美英欧盟等地访问 — tokenbender · 2026-08-03
- 生物科技从业者呼吁多用 DeepSeek 与 Qwen:查中文技术信息更好用 — MWCvitkovic · 2026-08-03
- tinygrad 预告本地部署新品,暗示 Qwen3.6-27B 即将发布 — max_paperclips · 2026-08-03
- 美国已非开源模型安全区?MiniMax 闭源引发行业担忧 — cocktailpeanut · 2026-08-03
- 传 Qwen3-Max 将开源,2.4T 参数比肩 Sonnet 且价格极低 — bindureddy · 2026-08-03