独立开发者用 VoxCPM 复刻千万粉网红声音,实时对话端到端延迟仅 3 秒

面壁智能 · wechat · 2026-08-07

独立开发者叶小叔分享了使用面壁智能开源模型 VoxCPM 构建实时语音对话系统的全过程。他尝试了 STT→LLM→TTS 的三段式架构,发现主流云端 TTS(如 Cartesia)在中文表现不佳,而本地小模型推理又太慢。

最终他选择将 VoxCPM 部署在云 GPU(RunPod L4,$0.4/小时)上,实现了首包延迟不到 1 秒、端到端 2-3 秒的流畅体验。他总结出一个反直觉经验:VoxCPM 的默认参数在音色相似度与自然度间已达最佳平衡,开启依赖参考音频的“极致克隆”反而会引入不必要的情绪波动。该 Demo 在抖音获百万播放,验证了开源语音模型在情绪陪伴场景的潜力。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →