MiniMax 发布 Music 3:支持生成 5 分钟完整歌曲
huggingface · x · 2026-08-14
MiniMax 在 Hugging Face 上发布了高性能音乐生成模型 MiniMax Music 3。该模型支持根据歌词和音乐描述生成最长 5 分钟的完整歌曲,具备长程结构连贯性、富有表现力的人声和演变的编曲。
技术架构:
- 结合了用于长程音乐结构的 8B 全局 LLM 和用于帧级声学细节的 0.6B 局部 LLM。
- 采用基于 Flow Matching 和 Flow-VAE 的连续隐状态合成系统。
- 输出 32 kHz、16 位立体声 WAV 音频。
控制能力:支持细粒度的音乐控制,接受歌词(包含 [Verse], [Chorus] 等段落标签)和结构化音乐描述(涵盖流派、BPM、音阶、人声性别与音色等)作为输入。
所属事件:MiniMax 开源 Music 3 音乐生成模型(14 条相关)→
「模型」频道最新
- Vercel 为 eve agents 免费提供 GLM 5.2 模型 — cramforce · 2026-08-14
- SemiAnalysis:DeepMind大换血,Gemini掉队致GCP成最大赢家 — ben_j_todd · 2026-08-14
- Grok 4.6 发布引爆用量,马斯克宣布重置并提供更多免费额度 — EricBuess · 2026-08-14
- Grok 4.6 登顶 GPQA Diamond,以 94.9% 跑分击败 GPT-5.6 — elonmusk · 2026-08-14
- a16z 合伙人实测 Grok 4.6:长任务与复杂代码能力出色 — elonmusk · 2026-08-14
- 前沿大模型 Token 价格一览:侧面折射模型规模差异 — sergeykarayev · 2026-08-14