WanSong 纯扩散模型支持 5 分钟长歌生成
Crazy-Repeat-2006 · reddit · 2026-08-15
WanSong v1.0 技术报告发布。这是一个基于纯扩散框架的长音乐生成模型,可一次性输出最高 5 分钟的高保真双音轨(人声与伴奏)。相比级联架构,它简化了流程并支持通过步蒸馏加速推理,适用于商业级歌曲生成与编辑任务。
「多模态」频道最新
- LTX 2.5 视频生成效果惊人,画质逼真 — tom_doerr · 2026-08-15
- 用Minimax H3 r2v + Turbo LoRA制作T恤品牌社媒视频概念 — Time-Ad-7720 · 2026-08-15
- AI 视频已能生成《办公室》剧集成小众迷因 — venturetwins · 2026-08-15
- AI 音乐视频《武则天》发布:36 镜头 3 分 24 秒英文演唱版 — Hongyi_AI · 2026-08-15
- ComfyUI 能否本地生成 3D 模型?新用户寻求实践指南 — jcam12312 · 2026-08-15
- MiniMax H3 生成视频 Demo:14 分钟产出,0.6MP 放大至 1.2MP — FionaSherleen · 2026-08-15