MiniMax 官方解答 H3 开源模型架构与工作流细节

MiniMax 稀宇科技 · wechat · 2026-08-08

MiniMax 技术团队在 Reddit 社区举办了 AMA 问答,针对开源模型 H3 的核心架构、视频生成局限及后续计划进行了深度解答。

核心架构与训练:H3 没有使用 MSA,其稀疏注意力策略更接近 MoBA,目前默认仅对占比最大的视频 token 做 3D 稀疏化。为更好控制多模态训练平衡,模型采用独立的视觉和音频 VAE。团队发现,仅训练「预测末帧」任务的模型也能在图像编辑上展现出强大的零样本泛化能力。

技术局限与优化:当前 H3 尚未原生训练由多个递归片段组成的长轨迹,长视频续写主要依赖参考条件(Ref2VA)。针对 Ref2VA 画质偏糊、远景人脸崩坏等问题,官方正在拆解影响因素并推进改进。由于模型参数高达 600 亿,团队正重点推进量化和卸载优化,并探索步数蒸馏以降低推理成本。

后续开源计划:官方计划开源一个同时支持文生图和图像编辑的统一模型,该模型将与 H3 共享 VAE 编码器。此外,第二阶段条件生成模块 Regenerate-2K 也将待效率与质量提升后开源。

所属事件:MiniMax团队举办H3开源视频模型AMA(3 条相关)→

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →