Pocket TTS:CPU 上 5 秒克隆任意声音

gvij · reddit · 2026-07-06

法国 Kyutai 的 Pocket TTS 是约 1 亿参数的流式语言模型,经 Mimi 神经编解码器生成音频 token,无需 GPU 即可用 5 秒参考音频零样本克隆任意声音,MIT 许可、pip 即装。作者将其与 Kokoro、Supertonic、Inflect-Nano 三款 CPU TTS 模型对比,180 次定时测试显示其延迟随文本长度几乎不变(RTF 0.69-0.76)、支持流式输出,虽为四款中最慢却最具特色。

所属事件:Kyutai开源可在CPU端运行的声音克隆模型Pocket-TTS(4 条相关)→

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →