MiniMax H3 支持图+音生视频,实测口型同步效果惊艳
multimodalart · x · 2026-08-18
开发者测试了 MiniMax H3 模型的图像与音频生成视频能力,通过输入图片和音频而非让模型自动生成音频。实测结果显示,该流程在口型同步和动作自然度方面表现惊人。作者已将该功能集成到 Diffusers 的 i2v 版本中并发布了 Demo。
所属事件:MiniMax H3实测:图+音生视频口型同步惊艳(4 条相关)→
「多模态」频道最新
- 短片 FARMS:Grok 与 Runway 联手打造 2049 南非 — bennash · 2026-08-18
- Fal 平台上线 Topaz Labs 全套模型,提供 16 个媒体增强端点 — OdinLovis · 2026-08-18
- Grok 4.6 助力生成 Sub8 游戏角色 — Daniel_Farinax · 2026-08-18
- 开源 3D「太阳神庙」原型:建筑、动画与特效一次集齐并附在线 Demo — techartist_ · 2026-08-18
- Stable Diffusion 双卡混用性能解析 — djekler · 2026-08-18
- Suno Studio 2.0 发布一周,音频转换功能引关注 — suno · 2026-08-18