开源 AudioSlopServer:单卡托管多个音频扩散模型

SteveLittleFish · reddit · 2026-09-20

Reddit 用户开源了 AudioSlopServer,一个在单张 GPU 上托管多个音频生成模型的服务,采用宽松许可证。

实现方式:

已集成服务: YuE 2、ACE-Step 1.5 XL、Stable Audio 3、DEMUCS(人声分离)、强制对齐器(歌词对齐)。计划加入 TTS 和 STT,目标是搭建完整 AI 电台。

示例工作流: 用 ACE-Step 生成歌曲 → 分离人声与伴奏 → 将伴奏送入 Stable Audio 3 再处理 → 混回人声,可修复 ACE-Step 吉他音色发怪的问题。

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →