数据科学家从零搭建 TTS:PostNet 使 WER 从 14.5% 降至 8.8%

Ashkingz · reddit · 2026-09-07

一位有两年经验的数据科学家为真正理解 TTS 内部原理,从零构建了完整管线:CTC 强制对齐 → FastSpeech2 声学模型 → 独立 PostNet → 微调 HiFi-GAN 声码器,训练于 LJSpeech-1.1,代码与权重均已开源。

结果(100 条验证集,Whisper base.en 打分):

亮点:自然停顿处理

踩坑复盘

已知局限:基于音素工作可处理未见词,但会卡在不熟悉的音素序列上——如全语料只出现两次的叠词 "Higgledy-piggledy" 被拉长,因时长预测器对该序列模式没有先验。

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →