WanSong: 5-Minute Long Song Generation Model

Wan-AI · hf · 2026-07-17

## WanSong v1.0: A Pure Diffusion Model for Long Song Generation Wan-AI released the technical report for **WanSong v1.0**, aiming for "commercial-grade" long-form song generation. The authors believe the current difficulty in music generation lies in achieving high fidelity, long duration, and controllability/customization simultaneously. ### Model Features - Adopts a **pure diffusion** approach, rather than AR or cascaded multi-stage pipelines - Can directly generate high-fidelity, multilingual songs up to **5 minutes** long - A single generation outputs dual tracks: **vocals + accompaniment** - Supports inference speedup via **step-distillation** - Provides highly efficient fine-tuning and customization paths for downstream editing tasks This report focuses not on isolated demos, but on pushing the efficiency, quality, and controllability of long-form music generation forward together.

Related event: Wan Team Releases WanSong Music Generation Model(2 posts)→

Original post →

More from Multimodal

Multimodal channel →