巧用 32x32 像素 trick:在 ComfyUI 中让 MiniMax H3 生成多人对话音频

sktksm · reddit · 2026-08-09

作者分享了在 ComfyUI 中使用 MiniMax H3 模型生成多分钟、多人对话音频的硬核实践。核心技巧是将视频潜空间分辨率设为极小的 32×32 像素,从而大幅削减视频流计算量,迫使模型将几乎全部算力倾注于音频流,最终生成高质量的广播剧效果。

由于 H3 模型原生音频输出上限约为 15 秒,超出该训练窗口会导致音频质量崩塌(人声混杂、变成乱码)。为解决长对话生成问题,作者探索出了一套精细的控制策略:

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →