Pocket TTS:CPU 上 5 秒克隆任意声音
gvij · reddit · 2026-07-06
法国 Kyutai 的 Pocket TTS 是约 1 亿参数的流式语言模型,经 Mimi 神经编解码器生成音频 token,无需 GPU 即可用 5 秒参考音频零样本克隆任意声音,MIT 许可、pip 即装。作者将其与 Kokoro、Supertonic、Inflect-Nano 三款 CPU TTS 模型对比,180 次定时测试显示其延迟随文本长度几乎不变(RTF 0.69-0.76)、支持流式输出,虽为四款中最慢却最具特色。
所属事件:Kyutai开源可在CPU端运行的声音克隆模型Pocket-TTS(4 条相关)→
「多模态」频道最新
- Synthesia 上线自定义 Avatar:文字提示即可生成虚拟主播 — synthesiaIO · 2026-09-11
- CapCut 桌面版上线 Seedance 2.5,单次生成 30 秒视频 — anthara_ai · 2026-09-11
- Marigold V2 发布:单步扩散 Transformer 刷新单目深度估计 SOTA — AntonObukhov1 · 2026-09-11
- 紫光下梯子上的舞者:一段疑似AI生成的惊艳视频demo — misovalko · 2026-09-11
- 支持阿拉伯语的AI视频生成模型盘点与口型同步实操方案 — aziz4ai · 2026-09-11
- 用 Hermes Agent 装 YuE2 复刻 Minimax 歌曲,16GB 显存跑通 — wzwowzw0002 · 2026-09-11