MiniMax 发布全模态模型 H3,支持原生双声道 2K 音视频生成

智东西 · wechat · 2026-07-31

MiniMax 发布全模态生成模型 MiniMaxH3,能统一理解文本、图像、视频和声音,并原生生成带双声道的音视频,最高支持 15 秒 2K 分辨率输出。

该模型打破了以往文生图、图生视频、音色参考等隔离的任务管线,在预训练阶段即混合多模态数据进行统一建模,用户可通过自然语言自由组合不同素材进行创作。官方称其在 ArtificalAnalysis 文生视频有声榜单中排名第二。

价格方面,MiniMax 宣称 H3 在 2K 分辨率下每秒成本不到主流模型的 1/3,并计划在未来几天内合规开放模型权重。

所属事件:MiniMax发布全模态模型H3,支持2K原生立体声视频(16 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →