MiniMax 发布全模态模型 H3:支持原生双声道与 2K 视频
MiniMax 稀宇科技 · wechat · 2026-07-31
MiniMax 正式发布全模态生成模型 H3。该模型统一了文本、图像、视频和声音的理解与生成能力,支持原生双声道音频输出,最高可生成 15 秒 2K 分辨率的视频。
核心特性与技术亮点:
- 多模态上下文理解:用户可通过自然语言描述参考素材(视频、图片、音频)与目标视频的关系,实现复杂的跨模态编辑与生成。
- 架构与成本优化:引入全新的 H3-VAE 和 H3-OmniTransformer 架构,大幅提升压缩率与训练吞吐量。模型在 2K 分辨率下的每秒生成价格不到主流模型的 1/3,主打行业最优性价比。
- In-context Regeneration:放弃传统超分模块,直接利用基座模型结合多模态上下文进行重生成,实现高质量的 2K 画面提升。
开源与商业化:
H3 具备商用级多场景内容生成能力,广泛适用于广告、电商、游戏等领域。官方宣布计划在未来几天内开放模型权重,以推动开源社区发展并加速国产芯片适配。
所属事件:MiniMax 发布全模态模型 H3(3 条相关)→
「模型」频道最新
- MiniMax 发布 H3 视频模型,原生 2K 音频即将开源 — Hoodfu · 2026-07-31
- GPT-5.6 Luna 降价 80% 后实测:极速生成全栈代码 — BorisMPower · 2026-07-31
- Glass AI医疗测试夺冠,超越OpenAI与谷歌 — GlassHealthHQ · 2026-07-31
- 特定提示词诱发的 Claude Opus 异常行为引发预测市场押注 — rgblong · 2026-07-31
- 预测 GLM 5.5 将成下一代大模型:开源有望追平前沿 — bindureddy · 2026-07-31
- 专家断言 LLM 进步停滞,仅靠可验证奖励提升代码与数学 — burkov · 2026-07-31