数据科学家从零搭建 TTS:PostNet 使 WER 从 14.5% 降至 8.8%
Ashkingz · reddit · 2026-09-07
一位有两年经验的数据科学家为真正理解 TTS 内部原理,从零构建了完整管线:CTC 强制对齐 → FastSpeech2 声学模型 → 独立 PostNet → 微调 HiFi-GAN 声码器,训练于 LJSpeech-1.1,代码与权重均已开源。
结果(100 条验证集,Whisper base.en 打分):
- WER:PostNet 开 8.8% vs 关 14.5%;CER 5.1% vs 8.2%;MCD 7.02 vs 7.54 dB;RTF 0.080
- 真实音频经同一 Whisper 评分的底线是 4.9% WER,剩余差距经人工检查主要来自数字转写与专有名词,而非合成失败
亮点:自然停顿处理
- 不用单独的停顿预测模型,而是在 CTC 对齐的间隙插入 <sil> token,同时以时长(≥6 帧,约 120ms)和能量(均方根低于整句最大值 5%)为门控——能量门控是关键,因为塞音闭合本身静音超 100ms,否则会被误判为词中停顿
踩坑复盘
- 从官方 jik876 LJV1 checkpoint 微调 HiFi-GAN 生成器、判别器随机初始化,输出刺耳金属感;根因是随机初始化的判别器与已很强的生成器冷启动对抗,换用官方 universal checkpoint 的判别器权重后 dloss 稳定在 1.6–2.2
已知局限:基于音素工作可处理未见词,但会卡在不熟悉的音素序列上——如全语料只出现两次的叠词 "Higgledy-piggledy" 被拉长,因时长预测器对该序列模式没有先验。
「多模态」频道最新
- WAN 最新版本视频生成实测:效果到底有多惊人? — Comfortable_Post_631 · 2026-09-07
- HoloWorld 发布:跨尺度上下文统一室内外 3D 城市生成 — Xiaobin Huang · 2026-09-07
- AI 视频短片预告:公元 828 年偷圣徒遗骨的世纪大劫案 — Adept-Discussion2059 · 2026-09-07
- 网友用 ChatGPT+Krea+MiniMax H3 打造宝可梦同人小电影 — Hailuo_AI · 2026-09-07
- 日本创作者实测 Codex 联动 PixVerse,把四神凤凰创意直接交给 agent 生成视频 — Hailuo_AI · 2026-09-07
- NoSpoon 自动生成最长 30 分钟的 AI 微短剧,作者直呼上瘾 — Kyrannio · 2026-09-07