Generating Multi-Speaker Dialogue Audio in MiniMax H3 via 32x32 Pixel Trick

sktksm · reddit · 2026-08-09

A developer shared a hardcore workflow for generating multi-minute, multi-speaker dialogue audio using the MiniMax H3 omni-modal model in ComfyUI. The core trick is setting the video latent size to a tiny 32×32 pixels, which makes the video stream negligible and forces almost all of the model's capacity into generating high-quality audio.

Because H3's native output limit is about 15 seconds, generating longer clips causes quality to collapse into gibberish. To create seamless long-form dialogue, the author developed specific pacing controls:

Original post →

More from coding & agent

coding & agent channel →