WanSong:五分钟长歌生成模型
Wan-AI · hf · 2026-07-17
## WanSong v1.0:面向长篇歌曲生成的纯扩散模型 Wan-AI 发布 **WanSong v1.0** 技术报告,目标是做“商业级”的长篇歌曲生成。作者认为当前音乐生成的难点在于:既要高保真、又要长时长,还要支持可控和定制。 ### 模型特点 - 采用**纯扩散**方案,而不是 AR 或级联多阶段流水线 - 可直接生成最长 **5 分钟** 的高保真、多语言歌曲 - 一次生成即可输出双轨:**人声 + 伴奏** - 支持通过 **step-distillation** 提升推理速度 - 也提供较高效的微调和定制路径,便于下游编辑任务 这篇报告的重点不在单点 demo,而是把长篇音乐生成的效率、质量和可控性一起往前推进。
所属事件:Wan 团队发布 WanSong 音乐生成模型(2 条相关)→
「多模态」频道最新
- Grok Imagine 的 Agent mode 新增裁切功能,方便做视频转场 — elonmusk · 2026-07-21
- Fable 生成歌曲时会自动检查 dB,防止听感过炸 — Sauers_ · 2026-07-21
- Gaussian splat 把旧金山大教堂做成 3D 场景 — ciguleva · 2026-07-21
- ComfyUI 基准显示 NVFP4 可加速 Flux 和 Qwen-Image 等模型 — Certain-Will-2769 · 2026-07-21
- Midjourney 发出一组超现实时尚生成图 — ciguleva · 2026-07-21
- Grace Cathedral 做成了空地融合的互动 3D 扫描 — nptacek · 2026-07-21