小米发布MiDashengLM-Gen,一键生成全场景音效

solyarisoftware · x · 2026-08-16

小米在 Hugging Face 发布了 MiDashengLM-Gen 模型。该模型支持通过单个 Prompt 生成场景的六种标记视图(包括字幕、转录、语音、音乐、音效、房间声学),并将其渲染为单个 16kHz 音频片段,使整个场景在音频中变得生动。目前已在 Spaces 上提供演示。

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →