MiniMax H3 支持图+音生视频,实测口型同步效果惊艳

multimodalart · x · 2026-08-18

开发者测试了 MiniMax H3 模型的图像与音频生成视频能力,通过输入图片和音频而非让模型自动生成音频。实测结果显示,该流程在口型同步和动作自然度方面表现惊人。作者已将该功能集成到 Diffusers 的 i2v 版本中并发布了 Demo。

所属事件:MiniMax H3实测:图+音生视频口型同步惊艳(4 条相关)→

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →