CPU 端四款开源 TTS 横评,仅 Pocket TTS 支持克隆
gvij · reddit · 2026-07-06
作者在 CPU 上对比四款开源 TTS 模型(含 Kyutai 新发布的 Pocket TTS)。Pocket TTS 是首个支持零样本声音克隆的 CPU 开源模型(5 秒参考音频),MIT 许可、pip 即装。横评显示:Kokoro 82M 质量最高(MOS 4.46)但不支持克隆;Supertonic 3 五步法速度较快(4.2x)适合视频配音;Inflect-Nano 最快但音质发闷;Pocket TTS 最慢(1.4x)却是唯一能克隆声音的选择。
所属事件:Kyutai开源可在CPU端运行的声音克隆模型Pocket-TTS(4 条相关)→
「多模态」频道最新
- Synthesia 上线自定义 Avatar:文字提示即可生成虚拟主播 — synthesiaIO · 2026-09-11
- CapCut 桌面版上线 Seedance 2.5,单次生成 30 秒视频 — anthara_ai · 2026-09-11
- Marigold V2 发布:单步扩散 Transformer 刷新单目深度估计 SOTA — AntonObukhov1 · 2026-09-11
- 紫光下梯子上的舞者:一段疑似AI生成的惊艳视频demo — misovalko · 2026-09-11
- 支持阿拉伯语的AI视频生成模型盘点与口型同步实操方案 — aziz4ai · 2026-09-11
- 用 Hermes Agent 装 YuE2 复刻 Minimax 歌曲,16GB 显存跑通 — wzwowzw0002 · 2026-09-11