Yue2 开放 AudioEncoder 模型,实现类 Image2Image 的 Audio2Audio 工作流

TomLikesRobots · x · 2026-09-13

Yue2 除常规生成模型外还开源了 AudioEncoder 模型,可将音频文件转为 latent 数据处理,实现类似图片领域 Image2Image 的「Audio2Audio」生成。作者用它重新生成自己此前 MV 的歌曲,曲风氛围基本保留,细节与声质产生差异,形成一种有趣再编曲玩法。另注:不输入歌词时也能生成,但不会输出日文歌词,而是类似英语的“谜之语言”。引用帖为作者用 Qwen3.8-27B 生成歌词、AceStep1.5XL 生成音乐、Krea2 生成角色、MinimaxH3 Ref2V 生成影像的 AI 歌手 MV 作品。

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →