MiDashengLM-Gen:LLM 驱动的混合音频场景生成

fruesome · reddit · 2026-08-16

MiDashengLM-Gen 是一个端到端框架,利用预训练大语言模型和音频 Tokenizer 作为骨干,结合基于 Token 的条件流匹配(Autoregressive Flow Matching),能够从结构化文本描述生成混合语音、音乐、音效和环境音的连贯音频场景。

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →