TTS 静默吞掉 17% 文本无人察觉,开发者据此做出本地多角色有声书工具 VoxStage
HoujunDev · reddit · 2026-10-07
作者发布 VoxStage,一个跑在 Apple Silicon Mac 上的本地文字转语音工作站:粘贴无角色标注的小说章节,生成多角色朗读,可逐句试听、修改、重做并导出,全程本地运行,无账号、无云 API、无遥测(AGPL-3.0 开源)。
起因:此前本地语音克隆测试中,一段长文朗读流畅自然,但中间 40 字符(约 17%)被静默吞掉,剩余文本读起来仍是正常句子,听不出来。由此确立两条设计规则:
- 逐句生成,绝不整段生成
- 用本地 whisper.cpp 把每句转写回来与原稿 diff,不一致处仅标记供人耳复核,绝不自动纠正
技术栈:Qwen3-TTS on MLX(预设音色/描述设计音色/克隆)、llama.cpp 本地 LLM(Qwen3-14B 或 32GB 上的 Qwen3-30B-A3B)起草每句说话人、whisper.cpp 回读校验。
实测(M2 Max 32GB,《傲慢与偏见》第 1 章):35 个单元说话人起草 14.8 秒;28 句合成 144.7 秒音频耗时 51 秒(RTF 0.358);回读校验 28 秒。
已知局限:说话人草稿多数场景需人工至少改一处,复核环节是产品核心;目前仅中英文;安装仍是开发者式(Homebrew + 终端,约 30 分钟,多为模型下载)。
其他功能:改一句只重生成一句、按实际音频定时输出 SRT/VTT 字幕、可导入 DaVinci Resolve 的 FCP7 XML 时间线、长文按书/章节管理角色。
「多模态」频道最新
- Jordi Pons 推出 AI 互动音乐游戏「一只鸡死了」 — jordiponsdotme · 2026-10-07
- LichtFeld 稠密化插件大提速:85.5 秒降至 16.7 秒 — janusch_patas · 2026-10-07
- Nano Banana 2.1 发布:画质提升修 bug,价格更低 — OfficialLoganK · 2026-10-07
- OmniReasoning:音视频联合推理基准,较 Qwen3-Omni 提升 12.8 点 — _akhaliq · 2026-10-07
- Seedance 2.5 单次生成 30 秒巴黎万圣节短片,480p 上采样到 1080p — LudovicCreator · 2026-10-07
- Kling 4.0 Flash 短片:机器人向人类承诺「残忍不复存在」 — LudovicCreator · 2026-10-07