WanSong: Pure Diffusion Model for 5-Minute Songs

Crazy-Repeat-2006 · reddit · 2026-08-15

WanSong v1.0 technical report released. It is a pure diffusion-based long-form music generation model capable of producing high-fidelity, dual-stem (vocals and accompaniment) songs up to 5 minutes in a single run. It simplifies cascaded pipelines and supports fast inference via step-distillation for commercial use.

Original post →

More from Multimodal

Multimodal channel →