audio.cpp 实现 MiniMax-H3:TTS/语音克隆/音乐生成,RTX 5090 上 3 倍实时

Acceptable-Cycle4645 · reddit · 2026-08-17

audio.cpp 项目实现了 MiniMax-H3 的文本到音频流水线,可用于 TTS、语音克隆和音乐生成。该实现比专用音频模型更灵活强大,在 RTX 5090 上性能可达 3 倍实时。它支持多说话人对话演示,并简化了 DiT 模型的设置,无需手动配置 SageAttention 等。此外,该实现还能生成视频帧,因为 DiT 同时生成音频和视频潜在表示。MiniMax-Music3 预览版已发布,支持 CUDA/Vulkan/HIP,VRAM 使用量取决于音频时长和提示长度。

所属事件:audio.cpp 0.6发布支持MiniMax-H3(2 条相关)→

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →