独立研究者自训音频模型:文本生成可演奏合成器并开源

RoyalCities · reddit · 2026-09-10

Reddit 用户 RoyalCities 发布自研音频模型 Foundation-1,目标是把「乐器」与「音色(timbre)」拆成两个独立可控维度——比如同一架钢琴既能温暖粗粝、也能冷冽明亮,这是现有模型做不到的控制粒度。他称攻克了跨多次扩散调用保持音色锁定键盘(presets)一致性的难题,并同步开源:

同时支持生成音乐制作用的无限 one-shot 采样。

所属事件:独立研究者开源 Foundation-1,文本直接生成可演奏合成器(2 条相关)→

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →