MiniMax 发布全模态模型 H3:支持 2K 立体声视频即将开源

MiniMax 正式发布全模态生成模型 H3,该模型统一了文本、图像、视频和声音的理解与生成能力。H3 最高可生成 15 秒 2K 分辨率的视频,并自带原生双声道音频输出,同时引入了 12 项资产参考功能。目前模型已上线海螺 AI 网页端、MiniMax API 以及 fal 平台,并即将以开放权重形式开源,其极具竞争力的定价引发了社区关注。

已确认

尚未确认

为什么重要

H3 的发布标志着视频生成模型在多模态融合上的进一步成熟。原生立体声音频与高质量 2K 画面的结合,配合精细的多素材参考控制功能,大幅降低了商业视频制作的门槛。同时,其具有竞争力的定价策略以及即将开源的举措,有望在当前的 AI 视频生成市场中快速抢占份额。

2026-07-30 ~ 2026-07-31 · 10 条相关

事件全程(共 4 集)→

一手来源

另有 2 条近重复转述:赛博禅心 · Hoodfu