MiniMax 发布开源音乐模型 Music3,支持生成 5 分钟完整歌曲
BanghuaZ · x · 2026-08-14
MiniMax 推出了新一代开源音乐生成模型 MiniMax-Music3。该模型能够根据歌词和详细的音乐描述,生成最长 5 分钟的完整歌曲,具备结构连贯、人声表现力丰富和稳定的长音频质量。
模型架构结合了多个组件:
- 8B 全局 LLM:负责长程的音乐结构。
- 0.6B 局部 LLM:处理帧级别的声学细节。
- 连续隐状态合成系统:基于 Flow Matching 和 Flow-VAE。
最终输出为 32 kHz、16 位立体声 WAV 音频。此外,模型支持细粒度的音乐控制,允许用户通过结构化标签(如主歌、副歌、桥段等)和音乐风格描述(流派、BPM、情感等)进行精准定制。目前该模型已上线 Hugging Face,并可通过 SGLang 进行部署。
所属事件:MiniMax 开源 Music 3 音乐生成模型(14 条相关)→
「模型」频道最新
- Vercel 为 eve agents 免费提供 GLM 5.2 模型 — cramforce · 2026-08-14
- SemiAnalysis:DeepMind大换血,Gemini掉队致GCP成最大赢家 — ben_j_todd · 2026-08-14
- Grok 4.6 发布引爆用量,马斯克宣布重置并提供更多免费额度 — EricBuess · 2026-08-14
- Grok 4.6 登顶 GPQA Diamond,以 94.9% 跑分击败 GPT-5.6 — elonmusk · 2026-08-14
- a16z 合伙人实测 Grok 4.6:长任务与复杂代码能力出色 — elonmusk · 2026-08-14
- 前沿大模型 Token 价格一览:侧面折射模型规模差异 — sergeykarayev · 2026-08-14