MiniMax 在 Hugging Face 开放 H3:33B 多模态视频模型带立体声
mark_k · x · 2026-08-04
MiniMax 在 Hugging Face 开源 H3,多模态视频模型可生成立体声
MiniMax 说 H3 已经在 Hugging Face 上开放。它是一个通用的 全模态生成模型,把 文本、图像、视频和音频 统一到一个上下文里。
- 支持生成带原生立体声的视频,最长可到 15 秒、2K 分辨率。
- 官方强调它在指令遵循、文字/品牌渲染准确性、以及视频到视频的动作迁移方面表现不错。
- 目标场景包括 广告、品牌、电商、产品设计和游戏。
- 帖子称它是一个 33B 参数 的 Omni-Transformer,并由 Qwen3-VL-32B 条件化。
- 目前提供 FL2VA 和 Ref2VA 两个 checkpoint,本地推理可用 Diffusers、SGLang、vLLM 和原生 ComfyUI。
所属事件:MiniMax 开源 33B 多模态视频模型 H3(2 条相关)→
「多模态」频道最新
- ChatGPT Work 把 Backrooms 提示词做成无缝 5 秒循环视频 — goodside · 2026-08-04
- Ostris AI Toolkit 开始支持 MiniMax H3 视频模型训练 — RayHell666 · 2026-08-04
- MiniMax 视频模型用户追问分辨率适配,同时称其效果最强 — Careless-Constant-33 · 2026-08-04
- Minimax H3 的 John Wick 式演示成了 AI 名场面 — Parogarr · 2026-08-04
- 一个 ComfyUI 工作流把 Wan 2.2 图生视频延到约 45 秒 — embryo10 · 2026-08-04
- H3 演示里一个细节:权重会随对话变化 — Oatilis · 2026-08-04