两阶段采样解 MiniMax H3 音画质量取舍:5秒片约10分钟

CornyShed · reddit · 2026-09-02

针对 MiniMax H3 音频与视觉质量难以兼顾的通病,作者与 u/LFAdvice7984 设计了两阶段 ComfyUI 工作流:第一阶段生成音频,第二阶段生成视觉,最后合并输出——音画各自独立调参,不再互相妥协。支持文本、首尾帧或音频输入转视频(后者为单阶段)。

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →