3.5 小时数据训出近人声希腊语 TTS,确定性提示解决说话人漂移
kastnerkyle · x · 2026-09-13
Interspeech 2026 论文《Deterministic Prompting for Speaker-Stable Low-Resource Greek TTS》展示如何在数据稀缺语种上做出高质量单说话人 TTS。
- 数据策展:用 WhisperX 对齐和过滤,把有声书录音转成 TTS 可用数据
- 底座:微调 880M 的多语提示式模型 Parler-TTS,其预训练编码了可迁移到希腊语的语音先验
- 关键发现:LLM 生成的风格提示会在推理时引起说话人漂移;改用确定性提示即可解决
- LoRA 锚定:仅用 3.5 小时单说话人数据训练说话人专属 LoRA(约 5% 参数),稳定音色
- 成绩:WER 10.7%(仅比 ASR 下限高 2.9),MOS-I 4.00(人声 4.36),说话人一致性 MOS-C 4.24(人声 4.30)
结论:有限策展数据即可实现鲁棒的单说话人希腊语 TTS。
「多模态」频道最新
- 100 版设计稿加 AI 视频混剪:Lenny's Summit 幕后制作揭秘 — lennysan · 2026-09-14
- 开源工具 Livebound:把本地 AI 生图库变成 CivitAI 发布工作台 — MoonbearAIArt · 2026-09-14
- 一滴咖啡生成整座城市,MiniMax H3 设计中心实测惊艳 — umesh_ai · 2026-09-14
- 「AI永远做不出这种质量」遭打脸,Higgsfield 一句反问回击 — _AustinCalvert_ · 2026-09-14
- 导演 Ruairi Robinson 发布 AI 生成 MV《Are We Not Men?》 — FudgeAllOfYous · 2026-09-14
- 用 Luma 对话式编排多模型:Seedream 生成加 Flux 延长创作短片 — LudovicCreator · 2026-09-14