MiDashengLM-Gen:LLM 驱动的混合音频场景生成
fruesome · reddit · 2026-08-16
MiDashengLM-Gen 是一个端到端框架,利用预训练大语言模型和音频 Tokenizer 作为骨干,结合基于 Token 的条件流匹配(Autoregressive Flow Matching),能够从结构化文本描述生成混合语音、音乐、音效和环境音的连贯音频场景。
「多模态」频道最新
- 音乐超分 LLM:是否存在类似视频超分的音频增强模型? — LeatherRub7248 · 2026-08-24
- 描述梦境给AI龙,它即生成星球带你体验 — repligate · 2026-08-24
- 用金缮纹理修复3D模型编辑后的裂缝 — repligate · 2026-08-24
- 用 FL2VA 模型制作汉尼拔角色视频 — Nimblecloud13 · 2026-08-24
- MiniMax H3 助力复活中世纪短视频创作,工作流全公开 — zanatas · 2026-08-24
- NAPE 音频预训练法开源:无解码器 SOTA — kastnerkyle · 2026-08-24