MiniMax 发布全模态生成模型 H3,支持 2K 视频且价格低于主流 1/3
赛博禅心 · wechat · 2026-07-31
MiniMax 正式发布全模态生成模型 H3,支持文本、图像、视频、声音的统一理解与生成,可输出原生双声道音视频,最高支持 15 秒 2K 分辨率。H3 在指令遵循、文字与品牌信息呈现、视频到视频动作迁移(V2V Motion Transfer)等方面表现出色,适用于广告、电商、游戏等商业场景。
技术亮点:
- Contextual Omni Representation:增强多模态上下文理解,通过语言统一任务描述。
- H3-VAE:高压缩率带来 4 倍序列长度收益,降低训练推理成本。
- H3-OmniTransformer:理解与生成异构架构,端到端训练吞吐提升近 30%。
- In-context Regeneration:用基模对低分辨率结果进行上下文重生成,超越传统超分。
定价:2K 分辨率下每秒价格不到主流模型的 1/3,768P 下不到 1/2。
开源计划:未来几天内开放模型权重,并考虑国产芯片适配。
设计理念:打破任务边界,从专用迈向通用,统一图像、视频、音频生成任务。
所属事件:MiniMax 发布全模态模型 H3:支持 2K 立体声视频即将开源(10 条相关)→
「多模态」频道最新
- AI视频生成挑战足球赛季模拟,红黄牌与伤病机制全拉满 — talkaboutdesign · 2026-07-31
- 马斯克发布 xAI 新图像生成功能 Grok Imagine — elonmusk · 2026-07-31
- Beacon 模型:提升多模态智能体视觉推理的工具适应性与效果 — KlingTeam · 2026-07-31
- 海螺视频模型 MiniMax 3 宣布即将开源 — pheonis2 · 2026-07-31
- H3-Omni 架构解析:原生 2K 分辨率与上下文重绘技术 — bdsqlsz · 2026-07-31
- Flux 3 与 Minimax H3 宣布开源权重,视频生成再起波澜 — cocktailpeanut · 2026-07-31