TTS 静默吞掉 17% 文本无人察觉,开发者据此做出本地多角色有声书工具 VoxStage

HoujunDev · reddit · 2026-10-07

作者发布 VoxStage,一个跑在 Apple Silicon Mac 上的本地文字转语音工作站:粘贴无角色标注的小说章节,生成多角色朗读,可逐句试听、修改、重做并导出,全程本地运行,无账号、无云 API、无遥测(AGPL-3.0 开源)。

起因:此前本地语音克隆测试中,一段长文朗读流畅自然,但中间 40 字符(约 17%)被静默吞掉,剩余文本读起来仍是正常句子,听不出来。由此确立两条设计规则:

技术栈:Qwen3-TTS on MLX(预设音色/描述设计音色/克隆)、llama.cpp 本地 LLM(Qwen3-14B 或 32GB 上的 Qwen3-30B-A3B)起草每句说话人、whisper.cpp 回读校验。

实测(M2 Max 32GB,《傲慢与偏见》第 1 章):35 个单元说话人起草 14.8 秒;28 句合成 144.7 秒音频耗时 51 秒(RTF 0.358);回读校验 28 秒。

已知局限:说话人草稿多数场景需人工至少改一处,复核环节是产品核心;目前仅中英文;安装仍是开发者式(Homebrew + 终端,约 30 分钟,多为模型下载)。

其他功能:改一句只重生成一句、按实际音频定时输出 SRT/VTT 字幕、可导入 DaVinci Resolve 的 FCP7 XML 时间线、长文按书/章节管理角色。

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →