MiniMax H3口型同步缺陷实测:静音段嘴部仍动,附测量与规避方案

Prestigious_Cat85 · reddit · 2026-08-26

Reddit用户详细测试了MiniMax H3视频生成模型在音乐视频中的口型同步问题。发现即使音频正确(波形相关性0.9994),在纯乐器段落模型仍会让歌手嘴部微动,幅度约为演唱时的一半。用户通过帧差测量量化了问题,并尝试了多种方法(如调整调度器)均无效。最终采用结构性规避:在乐器间隙强制切换无嘴部镜头,成功率100%。用户还提出了关于turbo LoRA、步数、条件化静音等疑问,并分享了测量脚本。

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →