MiniMax-H3 模型上线:支持 2K 分辨率与原生立体声视频生成
VoidAsuka · x · 2026-08-03
MiniMax 在 Hugging Face 上公开了全新的全模态生成系统 MiniMax-H3。该模型能够统一理解由文本、图像、视频和音频组成的多模态上下文,并支持生成分辨率最高达 2K、时长最长 15 秒且带原生立体声的视频。
得益于面向任务泛化的系统设计,H3 在预训练阶段就具备了广泛的多模态理解与生成能力,能够很好地遵循复杂的多模态指令。此外,模型支持首尾帧控制等多种输入模式,并稳定支持包含中英文在内的 11 种对话语言。
所属事件:MiniMax 发布开源全模态模型 H3,支持原生 2K 音视频生成(14 条相关)→
「多模态」频道最新
- 开发者用 Grok 模型生成海妖之歌概念艺术 — bennash · 2026-08-03
- xAI 更新 Grok Imagine 1.5,图像生成效果引惊叹 — minchoi · 2026-08-03
- Seedance 视频模型实测:矢量风格图形清晰连贯 — bennash · 2026-08-03
- AI图像生成四年进化史:相同提示词效果天壤之别 — DreamFly_13 · 2026-08-03
- 实测 Claude 自定义 Skill:输入网址一键生成产品宣传视频 — Scobleizer · 2026-08-03
- MiniMax 发布 H3 模型:原生支持 2K 音视频生成 — Mobile-Pumpkin7944 · 2026-08-03