独立研究者开源音频模型:文本描述直接生成可演奏合成器
RoyalCities · reddit · 2026-09-10
独立音频研究者 RoyalCities 发布并开源了 Foundation-1 音频模型,能把文本 prompt 变成可无限生成 one-shot 采样、且完全可演奏的合成器。其核心创新是让模型将乐器与音色(timbre)作为两个独立可控维度——比如同一架大钢琴既可以温暖粗粝,也可以冰冷清亮,而它仍然是钢琴——这种控制粒度在现有模型中都没有。最难的部分是让 timbre 锁定的琴键在多次 diffusion 调用之间保持一致,作者声称已解决。
配套资源齐全:模型在 Hugging Face(RoyalCities/Foundation-1),推理管线 fork 了 stable-audio-tools 并开源在 GitHub,还发布了完整讲解视频与纯演示片段,其他创作者可以直接照着 vibe code 自己的文本转合成器工具。
所属事件:独立研究者开源 Foundation-1,文本直接生成可演奏合成器(2 条相关)→
「多模态」频道最新
- 用 Opus 和 GPT-5.5 修复 1905 年蜡筒录音,牧师之声首次可辨 — generativist · 2026-09-10
- Runway 接入 ChatGPT,对话内直接生成编辑视频和图片 — tlakomy · 2026-09-10
- Suno v6 实测:导入 GarageBand 钢琴曲即可翻唱配器,控制力大增 — RyanMorrisonJer · 2026-09-10
- 用 Fable + Claude Code 把乐谱 PDF 和 wav 合成视频,流程将自动化进 mtdt — doodlestein · 2026-09-10
- 用 Suno 创作「机器人灭绝人类后留下的歌」:We Leave the Lights On — AIandDesign · 2026-09-10
- H3 Turbo 实时生成支持最多 9 张参考图,角色风格稳定 — boudaboy · 2026-09-10