MiniMax H3 唇舞视频工作流:1.4MP 分辨率需 3-4 小时

TheDerminator1337 · reddit · 2026-08-26

作者分享了使用 MiniMax H3 制作对口型音乐视频的参考工作流,结合 FL2VA 和 REF2VA Lora,在 1.4MP 分辨率、20 步数下,使用稀疏注意力和 4B Qwen 文本编码器,单次 5090 渲染耗时 3-4 小时。若使用 1MP + 8 步数的 Turbo Lora,仅需 20-30 分钟。视频由 14 个 15 秒片段拼接而成以防止画质退化,但会导致服装漂移,建议使用服装参考图修复。作者建议未来将片段缩短至 7 秒以提高分辨率和生成速度。

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →