MIRA 智能体用意图细化为文本生成音乐,开源模型逼近 Suno 水平
Zekai Liu · hf · 2026-10-10
研究者提出 MIRA(Musical Intent Refinement Agent),解决文本生成音乐与用户意图对齐的问题。
- 动机:全局文本-音频相关性评分无法发现具体需求(配器、结构、节奏、情绪推进)上的失败,也难以捕捉模糊提示中的隐含意图。
- 方法:把意图对齐形式化为满足逐请求的可验证评分细则(rubric),据此构建由音乐专家整理真实平台请求的 MuRA-Bench;MIRA 在测试时先将请求意图落地为 rubric,再在有限预算内对黑盒生成器做提示词修订搜索,迭代生成-校验并用反馈引导轨迹感知树搜索。
- 结果:在开源与商业后端上,让开源生成器达到与 Suno、Mureka 等商业系统相当的水平。
「多模态」频道最新
- Qwen 语音双线拆解:云端可租的 Audio-3.1 与本地可跑的 TTS/ASR — lmoroney · 2026-10-10
- Qwen 语音双轨:云端租 Audio-3.1,或自部署 TTS/ASR — lmoroney · 2026-10-10
- Drama 发布 AI 表演编辑模型:强度滑杆自由改写拍摄表演 — iamfakhrealam · 2026-10-10
- HeyGen 官宣语音模型登顶盲测榜,API 半价促销至 10 月底 — HeyGen · 2026-10-10
- HeyGen 官宣语音模型登顶盲测榜,API 降价五成至 15 美元/百万字符 — HeyGen · 2026-10-10
- 作者自研图像模型 Latent Blend 上线,纯嵌入插值生成独特图像 — graycrawford · 2026-10-10