MiniMax 官方解答 H3 开源模型架构与工作流细节
MiniMax 稀宇科技 · wechat · 2026-08-08
MiniMax 技术团队在 Reddit 社区举办了 AMA 问答,针对开源模型 H3 的核心架构、视频生成局限及后续计划进行了深度解答。
核心架构与训练:H3 没有使用 MSA,其稀疏注意力策略更接近 MoBA,目前默认仅对占比最大的视频 token 做 3D 稀疏化。为更好控制多模态训练平衡,模型采用独立的视觉和音频 VAE。团队发现,仅训练「预测末帧」任务的模型也能在图像编辑上展现出强大的零样本泛化能力。
技术局限与优化:当前 H3 尚未原生训练由多个递归片段组成的长轨迹,长视频续写主要依赖参考条件(Ref2VA)。针对 Ref2VA 画质偏糊、远景人脸崩坏等问题,官方正在拆解影响因素并推进改进。由于模型参数高达 600 亿,团队正重点推进量化和卸载优化,并探索步数蒸馏以降低推理成本。
后续开源计划:官方计划开源一个同时支持文生图和图像编辑的统一模型,该模型将与 H3 共享 VAE 编码器。此外,第二阶段条件生成模块 Regenerate-2K 也将待效率与质量提升后开源。
所属事件:MiniMax团队举办H3开源视频模型AMA(3 条相关)→
「多模态」频道最新
- 收录 324 个图像提示词与 42 种 AI 视频镜头运动 — emmanuelvivier · 2026-08-08
- 实测 H3 文生视频复刻《黑客军团》:光影惊艳但人物一致性翻车 — Positive_Writing_883 · 2026-08-08
- ComfyUI视频生成求助:蝙蝠侠战衣鳍片为何变成羽毛状? — Guyserbun007 · 2026-08-08
- 单相机生成超逼真数字人,SIGGRAPH 亚洲新研究 — Scobleizer · 2026-08-08
- Grok Imagine 2.0 图像生成体验反超 ChatGPT — ns123abc · 2026-08-08
- 开源视频模型 Sulphur 众筹达标 87%,公开向社区征集数据集 — FusionCow · 2026-08-08