3 步采样造全曲对口型 MV:MiniMax H3 完整工作流与实测数据
Disastrous_Page_301 · reddit · 2026-09-16
Reddit 用户发布用 MiniMax H3 Extender 制作约 2 分 50 秒全曲对口型 K-pop 风格 MV 的完整方法论,17 个 1024×576 片段、虚拟歌手单一连续表演。
对口型关键做法:
- 按歌词句边界切分音频为 17 段,严格在最安静的换气处切割;
- 用 htdemucs 分离人声——全混音伴奏会完全淹没人声条件;
- 用官方保留语法 <Audio 1>: fullycopy - <Audio 1>,否则 H3 只把音频当音色参考、口型乱动;
- 参考图构图优先于提示词,半身「对麦唱歌」照的口型一致性远好于全景。
速度与基准: TaoMate 3 步 ref2va turbo LoRA,RTX 3090 上每 9.4 秒片段约 4–5 分钟(8 步为 12.5 分钟);音频包络相关性 0.944、零接缝损失。对比三种 LoRA,TaoMate 时序与电平最佳。
自动化质检「评审委员会」: 四道自动评分(音频对齐、Vision LLM 测口型 Pearson 相关、镜头稳定性、缺陷检测三帧多数投票),不合格片段自动重掷,分数更高且过缺陷门槛才替换。作者提醒门槛校准要小心——一次包络窗口错位导致好素材被误杀半天。
局限: 3 步采样严重压制镜头运动(3D 放大器可提升皮肤质感但耗时约 12 倍);快速唱段偶有音素漂移。工作流 JSON 与 QC 脚本待发布。
「编程与Agent」频道最新
- Grok Build v1.0.33 大更新:MCP 结构化 JSON、记忆管理与长会话可靠性提升 — XFreeze · 2026-09-16
- 12 本塑造工程思维的 DevOps 与 SRE 书单,从凤凰项目到 SRE 圣经 — _jaydeepkarale · 2026-09-16
- 可克隆的「Receipt Desk」:带一手信源验证的 AI 研究台 — tetsuoai · 2026-09-16
- YuE2 Studio 发布:本地开源音乐创作与 LoRA 训练一体化 Web UI — Cheap_Credit_3957 · 2026-09-16
- 独立开发者用 ElevenLabs 给古英语游戏配音,并全面重做 UI 与材质 — tomjohndesign · 2026-09-16
- AI Agent 缺的不是记忆而是状态完整性,开发者提出 State Ledger 方案 — thefeelgoodconductor · 2026-09-16