MiniMax-H3 模型上线:支持 2K 分辨率与原生立体声视频生成

VoidAsuka · x · 2026-08-03

MiniMax 在 Hugging Face 上公开了全新的全模态生成系统 MiniMax-H3。该模型能够统一理解由文本、图像、视频和音频组成的多模态上下文,并支持生成分辨率最高达 2K、时长最长 15 秒且带原生立体声的视频。

得益于面向任务泛化的系统设计,H3 在预训练阶段就具备了广泛的多模态理解与生成能力,能够很好地遵循复杂的多模态指令。此外,模型支持首尾帧控制等多种输入模式,并稳定支持包含中英文在内的 11 种对话语言。

所属事件:MiniMax 发布开源全模态模型 H3,支持原生 2K 音视频生成(14 条相关)→

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →