独立研究者开源音频模型:文本描述直接生成可演奏合成器

RoyalCities · reddit · 2026-09-10

独立音频研究者 RoyalCities 发布并开源了 Foundation-1 音频模型,能把文本 prompt 变成可无限生成 one-shot 采样、且完全可演奏的合成器。其核心创新是让模型将乐器与音色(timbre)作为两个独立可控维度——比如同一架大钢琴既可以温暖粗粝,也可以冰冷清亮,而它仍然是钢琴——这种控制粒度在现有模型中都没有。最难的部分是让 timbre 锁定的琴键在多次 diffusion 调用之间保持一致,作者声称已解决。

配套资源齐全:模型在 Hugging Face(RoyalCities/Foundation-1),推理管线 fork 了 stable-audio-tools 并开源在 GitHub,还发布了完整讲解视频与纯演示片段,其他创作者可以直接照着 vibe code 自己的文本转合成器工具。

所属事件:独立研究者开源 Foundation-1,文本直接生成可演奏合成器(2 条相关)→

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →