开源 AudioSlopServer:单卡托管多个音频扩散模型
SteveLittleFish · reddit · 2026-09-20
Reddit 用户开源了 AudioSlopServer,一个在单张 GPU 上托管多个音频生成模型的服务,采用宽松许可证。
实现方式:
- 对官方模型仓库做 fork,加上简单 API
- 为每个模型加 RAM offload,把权重卸载到系统内存
- 用一个编排器在模型间热切换,无法卸载的就直接停止
- 每个服务做成独立 Docker 镜像,便于合并上游更新
- 自带每个服务的测试 UI
已集成服务: YuE 2、ACE-Step 1.5 XL、Stable Audio 3、DEMUCS(人声分离)、强制对齐器(歌词对齐)。计划加入 TTS 和 STT,目标是搭建完整 AI 电台。
示例工作流: 用 ACE-Step 生成歌曲 → 分离人声与伴奏 → 将伴奏送入 Stable Audio 3 再处理 → 混回人声,可修复 ACE-Step 吉他音色发怪的问题。
「多模态」频道最新
- 开发者用 Midjourney 与 Kling 复刻 80 年代诡异 VHS 广告推广自家游戏 — sevencavesinteractiv · 2026-09-20
- MiniMax H3 三步 LoRA 实测:生成提速近 4 倍,画质仍略逊 Fused Turbo — cgpixel23 · 2026-09-20
- 用 MiniMax H3 Max 重制 2 小时电影,成本已降到几千美元级 — bennash · 2026-09-20
- Qwen Image 2.1 深度实测:参考图一致性强,可生成透明背景 — 13baaphumain · 2026-09-20
- AI 自动生成剧集:「下一集」按钮让模型不停产出新内容 — Kyrannio · 2026-09-20
- NoSpoon 微短剧 agent 接入 Grok Imagine,一键生成剧集海报 — Kyrannio · 2026-09-20