WanSong 可生成5分钟分轨歌曲
Justgototheeffinmoon · reddit · 2026-07-17
Wan 团队在 arXiv 发布了 WanSong 技术报告,介绍一个基于扩散的音乐生成模型:
- 可一次生成最长 5 分钟 的完整歌曲
- 生成结果里会同时保留 人声轨 和 伴奏轨,而且是在同一轮生成中直接输出
- 作者强调这不是自回归模型,也不是多阶段级联管线,而是 纯 diffusion 方案
- 论文还提到可以通过 step distillation 进一步加速
- 模型支持 fine-tuning / 自定义,便于下游编辑和二次创作
帖子认为,如果“分轨输出 + 可微调”的说法经得起独立验证,这类基础模型会特别利好做音乐编辑器、插件和工作流工具的团队,因为它比黑盒混音输出更容易接入。
所属事件:Wan 团队发布 WanSong 音乐生成模型(2 条相关)→
「多模态」频道最新
- Skyfall GS 登场:用 Flux 提升 Gaussian Splatting 精修质量 — ducha_aiki · 2026-09-11
- AI 电影节 Lumara 将登陆纽约,顶级 AI 电影人齐聚评审 — 0xAllen_ · 2026-09-11
- 翼龙侦探:全程 AI 生成的概念片先导预告亮相 — PterodactylDetective · 2026-09-11
- Imperium 游戏预告片曝光,AI 视频生成再秀肌肉 — keaslenyt · 2026-09-11
- FLUX.2 Klein 换表情易丢脸,实测不如免费版 Gemini 保真 — wacomlover · 2026-09-11
- 腾讯 AuK 语音模型开源代码与权重上线 GitHub,附 ComfyUI 支持 — aigclink · 2026-09-11