MiniMax H3 实测:图+音生成视频口型同步惊艳

multimodalart · x · 2026-08-18

开发者分享了利用 MiniMax H3 模型进行“图+音生视频”的测试结果。通过向 H3 输入图片和外部音频而非自动生成音频,生成的视频在口型同步和面部动作自然度上表现出色。作者已将该流程基于 Diffusers 实现 I2V 版本并提供了 Demo 链接。

所属事件:MiniMax H3实测:图+音生视频口型同步惊艳(4 条相关)→

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →