MiniMax 发布全模态模型 H3:支持 2K 原生立体声视频

MiniMax 正式发布全模态生成模型 H3,该模型统一了文本、图像、视频和声音的理解与生成能力。H3 最高可生成 15 秒 2K 分辨率的视频,并自带原生双声道音频输出,目前已上线 fal 平台,API 价格低于主流模型的三分之一,且即将以开放权重形式开源。

已确认

为什么重要

H3 的发布标志着视频生成模型在多模态融合上的进一步成熟。原生立体声音频与高质量 2K 画面的结合,配合精细的多素材参考控制功能,大幅降低了商业视频制作的门槛。同时,其具有竞争力的定价策略以及即将开源的举措,有望在当前的 AI 视频生成市场中快速抢占份额。

2026-07-30 ~ 2026-07-31 · 9 条相关

事件全程(共 3 集)→

一手来源

另有 2 条近重复转述:赛博禅心 · JGByvygyrfg