开源 Friendly Stable Audio 3:含完整训练管线的文生音频研究版
serrjoa · x · 2026-09-07
研究者 yukara-ikemiya 发布 Stable Audio 3 的重构简化版 friendly-stable-audio-3,面向研究人员和工程师:
- 完整训练管线:不只 LoRA 微调,包含 SAME 自编码器、流匹配扩散、latent CLAP、ARC 对抗后训练,全部可训
- 统一训练入口:scripts/train.py 用一个通用 Trainer 训练所有组件
- 配置优先:每个模型完全由 YAML 描述,无需下载不透明的 modelconfig.
- 分布式训练:通过 Hydra + HuggingFace Accelerate 支持多 GPU/多节点
上游官方仓库以推理为主,这个 fork 把训练栈完整暴露出来。
「多模态」频道最新
- 只靠一段提示词,创作者用 MiniMax H3 做出 2D 日系电音动漫 MV — Hailuo_AI · 2026-09-11
- 街景变 V2V:用 GPT Astra 取图、MiniMax H3 转车载视角实现「全球自驾」 — Hailuo_AI · 2026-09-11
- 单作者ECCV 2026论文:让卷帘快门失真修正实用化 — ducha_aiki · 2026-09-11
- AI 数字人翻唱《东爱》以假乱真,冷艳主播惊呆网友 — JourneymanChina · 2026-09-11
- ComfyUI 风格浏览器更新:LoRA 预览目录与分享功能 — neonsparksuk · 2026-09-11
- 博主分享 4 个 Midjourney V6 最爱风格码 --sref 直接可用 — michaelrabone · 2026-09-11