MiniMax 开源全能多模态模型 H3,支持原生立体声与 2K 视频生成
mishig25 · x · 2026-08-04
MiniMax 在 Hugging Face 上发布了开放权重的全能多模态生成系统 MiniMax-H3。该模型在预训练阶段即具备广泛的多模态上下文理解与生成能力,能遵循复杂的多模态指令。
核心功能与规格:
- 多模态统一理解:支持对文本、图像、视频和音频的统一理解。
- 高质量音视频生成:可生成最长 15 秒、最高 2K 分辨率、24 FPS 的视频,并原生生成 32kHz 立体声。
- 丰富的输入模式:提供首尾帧控制(FL2VA)等多种变体,支持图生视频、视频生视频、音频生视频等全栈操作。
- 多语言支持:稳定支持中、英、日、韩等 11 种语言的对话交互。
所属事件:MiniMax 发布开源全能多模态模型 H3(6 条相关)→
「模型」频道最新
- 7月AI大事件:模型价格战打响,开源追平闭源 — Dapper-Tale-4021 · 2026-08-04
- 实测替换 Codex 底层模型:Kimi K3 生成营销方案成本仅为 GPT-5.6 的四分之一 — AskItAll_Biych · 2026-08-04
- 腾讯混元发布 HyASR3.0 语音模型,多语种 WER 降至 3% 左右 — 机器之心 · 2026-08-04
- DeepSeek V4 成本仅为 Claude 1%:中国 AI 模型掀起价格战 — SirBoboGargle · 2026-08-04
- OpenAI 暗示下一代模型需更强算力,Codex 或向云端智能体演进 — haider1 · 2026-08-04
- 企业级AI部署痛点:模型切换成本远超性能差距 — sanjaykalra · 2026-08-04