两阶段采样解 MiniMax H3 音画质量取舍:5秒片约10分钟
CornyShed · reddit · 2026-09-02
针对 MiniMax H3 音频与视觉质量难以兼顾的通病,作者与 u/LFAdvice7984 设计了两阶段 ComfyUI 工作流:第一阶段生成音频,第二阶段生成视觉,最后合并输出——音画各自独立调参,不再互相妥协。支持文本、首尾帧或音频输入转视频(后者为单阶段)。
- 音频质量自评好到很好;默认 50 步偏过量但成功率优先。实用技巧:在 ComfyUI 选中输出节点点播放按钮,可只执行到该节点,先试听再全量生成。
- 视觉仍有提升空间(可换 turbo LoRA 或采样器);大幅运动是难点,作者设想加第三阶段用不同 shift 值。
- 生成耗时:5 秒片约 10 分钟、10 秒约 25 分钟、20 秒约 65 分钟。
- 已知问题:个别 prompt 理解偏差(ASMR、抽象片段),难判断是 prompt、enhancer 还是模型理解问题。
- 方法与模型无关,也可用于 LTX 2.5 或即将推出的 Flux 3 Dev。工作流 JSON 与 prompts 已传 Hugging Face,附 rgthree、KJNodes、RES4LYF 等自定义节点清单。
「多模态」频道最新
- WeMM-Embedding 登顶 MMEB-v3:9B 得 59.5 分,2B 超 7B/8B 模型 — tomaarsen · 2026-09-02
- MMEB-v2 实测:WeMM-2B 以四分之一体积胜过 Qwen3-VL-Embedding-8B — tomaarsen · 2026-09-02
- 视频检索差距最大:WeMM-2B 在 MMEB-v2 视频子集超 8B 达 3.7 分 — tomaarsen · 2026-09-02
- 腾讯开源 WeMM-Embedding:文本图像视频统一嵌入,Apache 2.0 — tomaarsen · 2026-09-02
- 两段式 latent 放大工作流里 LoRA 该接在哪一段? — joseph_jojo_shabadoo · 2026-09-02
- MiniMax H3 768x 唱歌口型半数翻车脸融化 — PersonalityLimp2593 · 2026-09-02