Xiaomi releases MiDashengLM-Gen for one-prompt scene audio generation
solyarisoftware · x · 2026-08-16
Xiaomi released MiDashengLM-Gen on Hugging Face. It generates six tagged views of a scene (caption, transcript, voice, music, sfx, room) from a single prompt, rendering the whole scene as a single 16kHz audio clip. A demo is available on Spaces.
More from Multimodal
- MiniMax H3 Motion Director: A ComfyUI Node for Multi-Segment Video Management — Acceptable-Chest9695 · 2026-08-16
- MiniMax Music 3.0 Studio: Integrating Music Generation into ComfyUI — MuziqueComfyUI · 2026-08-16
- Minimax H3 impresses in 720p test, but videos beyond 15 seconds lose consistency — cocktailpeanut · 2026-08-16
- MiniMax H3 r2v anime short experiment — Time-Ad-7720 · 2026-08-16
- Deadpool and Wolverine dinner date generated by MiniMax H3 — Alex_the_tiktock · 2026-08-16
- MiniMax H3 single-image edit workflow tested on RTX 5090 — Patient_Ratio4177 · 2026-08-16