实现 Minimax H3 模型无缝对口型视频生成

stonyleinchen · reddit · 2026-08-15

作者发布 ComfyUI 工作流更新,通过“逐 Token 噪声掩码”技术在音视频潜在空间实现无缝对口型。该方法优于基于引导/参考的传统方案,不仅能从第 0 步实现强收敛,且速度更快(不扩展潜在空间)。它将音轨固定在潜在空间而非作为参考,从而保护其免受去噪影响,即使使用 FL 模型也能完美对口型。

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →