MiniMax H3 公开权重,做成带原生立体声的多模态视频模型
mark_k · x · 2026-08-04
MiniMax H3 公开权重,做成统一多模态视频模型
MiniMax H3 已经在 Hugging Face 开放,帖子把它描述为下一代开源权重的 多模态视频模型,把文本、图像、视频和音频统一到一个上下文里。
重点信息包括:
- 可生成带 原生立体声 的视频,最长 15 秒、2K 分辨率。
- 擅长指令遵循、文字/品牌渲染,以及 video-to-video 的动作迁移。
- 面向 广告、品牌、电商、产品设计和游戏 场景。
- 帖子称 2K 价格不到主流模型的三分之一。
- 模型基于 33B 参数 Omni-Transformer,并以 Qwen3-VL-32B 作为条件模型。
- 提供 FL2VA 和 Ref2VA 两个 checkpoint,支持通过 Diffusers、SGLang、vLLM 以及原生 ComfyUI 本地推理。
作者认为这可能是目前最强的开源视频模型之一。
所属事件:MiniMax 开源 33B 多模态视频模型 H3(2 条相关)→
「多模态」频道最新
- ChatGPT Work 把 Backrooms 提示词做成无缝 5 秒循环视频 — goodside · 2026-08-04
- Ostris AI Toolkit 开始支持 MiniMax H3 视频模型训练 — RayHell666 · 2026-08-04
- MiniMax 视频模型用户追问分辨率适配,同时称其效果最强 — Careless-Constant-33 · 2026-08-04
- Minimax H3 的 John Wick 式演示成了 AI 名场面 — Parogarr · 2026-08-04
- 一个 ComfyUI 工作流把 Wan 2.2 图生视频延到约 45 秒 — embryo10 · 2026-08-04
- H3 演示里一个细节:权重会随对话变化 — Oatilis · 2026-08-04