CTC-TTS 论文:用 CTC 对齐替代 MFA,实现低延迟双流语音合成
kastnerkyle · x · 2026-09-13
arXiv 论文提出 CTC-TTS,一种基于 LLM 的双流式文本转语音系统。针对现有 LLM-TTS 多不支持低延迟双流合成的问题,作者用基于 CTC 的神经对齐器替代流程繁重的 MFA 强制对齐工具,并引入 bi-word 交错策略替代固定比例的文本-语音 token 交错。
论文设计了两个变体:
- CTC-TTS-L:token 沿序列长度拼接,追求更高合成质量;
- CTC-TTS-F:embedding 沿特征维度堆叠,追求更低延迟。
实验显示,CTC-TTS 在流式合成与零样本任务上均优于固定比例交错和基于 MFA 的基线方法。论文已提交至 INTERSPEECH 2026。
「多模态」频道最新
- 用 Luma 对话式编排多模型:Seedream 生成加 Flux 延长创作短片 — LudovicCreator · 2026-09-14
- 从生图到动效:一套暗黑风 ARPG 预告片的完整生成提示词 — techhalla · 2026-09-14
- HeyGen 开源全部产品发布视频:纯 HTML 合成可用 Claude Code 直接改 — _AustinCalvert_ · 2026-09-14
- Wan3.0 动漫打斗片段惊到网友:镜头调度合理动作连贯 — andrew_n_carr · 2026-09-14
- 3.5 小时数据训出近人声希腊语 TTS,确定性提示解决说话人漂移 — kastnerkyle · 2026-09-13
- 本想测 AI 视频能否撑起长片,结果做出了七部一小时电影 — bdylsing · 2026-09-13