小米发布MiDashengLM-Gen,一键生成全场景音效
solyarisoftware · x · 2026-08-16
小米在 Hugging Face 发布了 MiDashengLM-Gen 模型。该模型支持通过单个 Prompt 生成场景的六种标记视图(包括字幕、转录、语音、音乐、音效、房间声学),并将其渲染为单个 16kHz 音频片段,使整个场景在音频中变得生动。目前已在 Spaces 上提供演示。
「多模态」频道最新
- MiniMax H3 Motion Director:整合多片段管理的 ComfyUI 节点 — Acceptable-Chest9695 · 2026-08-16
- MiniMax Music 3.0 Studio:将音乐生成接入 ComfyUI 工作流 — MuziqueComfyUI · 2026-08-16
- Minimax H3 实测:720p 惊艳,长视频一致性不足 — cocktailpeanut · 2026-08-16
- MiniMax H3 r2v 动画生成实验展示 — Time-Ad-7720 · 2026-08-16
- MiniMax H3 生成死侍与金刚狼共餐 — Alex_the_tiktock · 2026-08-16
- MiniMax H3 单图编辑工作流实测 — Patient_Ratio4177 · 2026-08-16