Yue2 开放 AudioEncoder 模型,实现类 Image2Image 的 Audio2Audio 工作流
TomLikesRobots · x · 2026-09-13
Yue2 除常规生成模型外还开源了 AudioEncoder 模型,可将音频文件转为 latent 数据处理,实现类似图片领域 Image2Image 的「Audio2Audio」生成。作者用它重新生成自己此前 MV 的歌曲,曲风氛围基本保留,细节与声质产生差异,形成一种有趣再编曲玩法。另注:不输入歌词时也能生成,但不会输出日文歌词,而是类似英语的“谜之语言”。引用帖为作者用 Qwen3.8-27B 生成歌词、AceStep1.5XL 生成音乐、Krea2 生成角色、MinimaxH3 Ref2V 生成影像的 AI 歌手 MV 作品。
「多模态」频道最新
- Minimax 视频 seed 换参数即失效,创作者苦寻低分辨率预筛法 — fluce13 · 2026-09-14
- Midjourney V8.2 新风格亮相,出图效果引围观 — azed_ai · 2026-09-14
- OpenAI 高管用 Codex 内 Astra 3D 重现马里奥城堡并生成飞越视频 — romainhuet · 2026-09-14
- ComfyUI 插件 SmartSave 用本地 Ollama 自动按主体归类出图,已开源 — Cold-Worldliness5392 · 2026-09-14
- MiniMax Design 经 MCP 接入 Blender,3D 参考驱动 AI 视频制作 — Hailuo_AI · 2026-09-14
- 用 Seedance 2.5 把上学早晨拍成潜行游戏,节奏运镜惊艳 — SimplyAnnisa · 2026-09-14