MiniMax H3 视频模型发布:支持文本/图片生视频带音频

multimodalart · x · 2026-08-03

MiniMax 最新发布了 H3 视频生成模型,该模型参数量达 33B,支持文本生成视频、图片生成视频以及参考图生成视频,并且能在生成画面的同时产出同步音频。

目前模型权重已上线 Hugging Face,并且已适配 🧨 Diffusers 和 ComfyUI 工具栈,可供消费级 GPU 用户直接体验和使用。

所属事件:MiniMax-H3 模型卡曝光:支持图生视频与原生立体声(9 条相关)→

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →