audio.cpp 实现 MiniMax-H3:TTS/语音克隆/音乐生成,RTX 5090 上 3 倍实时
Acceptable-Cycle4645 · reddit · 2026-08-17
audio.cpp 项目实现了 MiniMax-H3 的文本到音频流水线,可用于 TTS、语音克隆和音乐生成。该实现比专用音频模型更灵活强大,在 RTX 5090 上性能可达 3 倍实时。它支持多说话人对话演示,并简化了 DiT 模型的设置,无需手动配置 SageAttention 等。此外,该实现还能生成视频帧,因为 DiT 同时生成音频和视频潜在表示。MiniMax-Music3 预览版已发布,支持 CUDA/Vulkan/HIP,VRAM 使用量取决于音频时长和提示长度。
所属事件:audio.cpp 0.6发布支持MiniMax-H3(2 条相关)→
「多模态」频道最新
- 智象原生多模态世界模型登顶 WBench 评测 — 机器之心 · 2026-08-17
- MiniMax H3 实测:8 种商业玩法,动漫风格视频生成性价比之选 — 卡尔的AI沃茨 · 2026-08-17
- 用Minimax H3生成20分钟动漫视频,附完整工作流 — shoryoucant · 2026-08-17
- 用 Luma Agents 制作的 AI 统治世界短片 — Kyrannio · 2026-08-17
- 曝大厂AI电影制作全流程:Seedance 2.5+Higgsfield打造百万美元影片 — EXM7777 · 2026-08-17
- ComfyUI 新节点:MiniMax H3 音频变形测试 — Accurate_Public4674 · 2026-08-17