3 步采样造全曲对口型 MV:MiniMax H3 完整工作流与实测数据

Disastrous_Page_301 · reddit · 2026-09-16

Reddit 用户发布用 MiniMax H3 Extender 制作约 2 分 50 秒全曲对口型 K-pop 风格 MV 的完整方法论,17 个 1024×576 片段、虚拟歌手单一连续表演。

对口型关键做法:

速度与基准: TaoMate 3 步 ref2va turbo LoRA,RTX 3090 上每 9.4 秒片段约 4–5 分钟(8 步为 12.5 分钟);音频包络相关性 0.944、零接缝损失。对比三种 LoRA,TaoMate 时序与电平最佳。

自动化质检「评审委员会」: 四道自动评分(音频对齐、Vision LLM 测口型 Pearson 相关、镜头稳定性、缺陷检测三帧多数投票),不合格片段自动重掷,分数更高且过缺陷门槛才替换。作者提醒门槛校准要小心——一次包络窗口错位导致好素材被误杀半天。

局限: 3 步采样严重压制镜头运动(3D 放大器可提升皮肤质感但耗时约 12 倍);快速唱段偶有音素漂移。工作流 JSON 与 QC 脚本待发布。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →