Sopro V2:1.2亿参数开源语音克隆TTS
SammyDaBeast · reddit · 2026-08-27
Sopro V2 是一个仅 120M 参数的开源零样本语音克隆 TTS 模型,支持英语、葡语、法语和德语,可在 CPU 上流畅运行。
核心亮点:
- 小参数高性能:参数量仅 1.2 亿,但在 Seed-TTS-eval 测试中 WER 为 1.51-1.65,性能超越比它大 3-14 倍的模型(如 F5-TTS, CosyVoice)。
- 低延迟流式:在 M3 CPU 上首音频延迟约 300ms,H100 上 RTF 低至 0.07。
- 易用性:提供浏览器 Demo 和 Python 包,一条命令即可启动本地 Web UI 服务。
- 语言支持:据称是首个原生支持欧洲葡萄牙语(而非巴西葡语)的开源 TTS。
「多模态」频道最新
- 专业特效工作室吐槽 ComfyUI:夜间渲染频发 OOM 成日常 — vfxthrowawaydotcom · 2026-08-27
- Google 发布 Omni 1.1 Flash:支持 4K 输出与插帧 — legit_api · 2026-08-27
- 用古英语单词当提示词:Midjourney 单词系列第 3 期 — tisch_eins · 2026-08-27
- Hark 宣布与 NVIDIA 合作,获千兆级算力支持多模态系统 — adcock_brett · 2026-08-27
- Minimax H3 本地部署实测:5秒片段需4分钟 — thevictor390 · 2026-08-27
- MiniMax 视频生成被吐槽:多轮迭代后华丽场景总变暗灰幕布 — Speeeedee · 2026-08-27