MiniMax H3开源视频模型上线ComfyUI,支持15秒768p生成

pmttyji · reddit · 2026-08-10

MiniMax H3 是一个开源的多模态视频生成模型,支持文本、图像、视频和音频。在 ComfyUI 中,可用于文生视频、图生视频、首尾帧生成和参考驱动创作。H3 能联合生成视觉和同步立体声(包括对话、音效、环境音和音乐),而非后期添加音频。开源权重支持最长15秒、768p的片段;托管版本支持高达2K分辨率。文章还讨论了H3如何将多种生成任务统一到一个架构,其高压缩视频表示如何提高效率,以及开发者本地部署的注意事项。

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →