团队梳理 113 篇 TTS 评测论文:WER 会毁韵律,论文间 MOS 不可比
Slight_Republic_4242 · reddit · 2026-09-09
一个语音 agent 团队为选 CI 评测指标,把 113 篇 TTS 评测论文映射到 50 叶子的分类体系,得出四个改变其做法的结论:
- WER 作优化目标会吃掉韵律。 arXiv 2509.18531 用 GRPO 训练以转写为导向的信号(CER/NLL),错误率下降但韵律坍缩成单调音;加入说话人相似度到奖励反而进一步破坏训练、恶化 CER。WER+SECS 当护栏可以,当目标不行。
- UTMOS 不具备跨域泛化。 TTScore(2509.20485)实测:UTMOS 在自己的训练域 VoiceMOS 上表现好,在 SOMOS 上退化到不如从未用 MOS 标签训练的指标。MOS 标注数据太少,发布门禁若依赖预测 MOS,需先在自己的音频上验证。
- 不同论文的 MOS 分数完全不可比。 Dagstuhl 最佳实践文档(2503.03250)直言不讳;TTS 没有真正的 MUSHRA(缺锚点),厂商互相引用 MOS 的对比是噪音。
- 真正关心的维度无人评测。 话轮转换、插话、端点延迟、流式前瞻的音质损失、8kHz 电话线路退化,都不在任何标准 TTS 分类里。相关文献(Full-Duplex-Bench、SPEARBench、FastTurn)存在但游离于 TTS benchmark 之外——大家都在测 24kHz 干净朗读语音,没人测有人插话的电话语音。
六个叶子几乎空白:缩写、URL/地址/公式、句法复杂度、语码转换、未见语言结构、口音,前三个基本靠 EmergentTTS-Eval 独撑。作者询问大家在 CI 里跑什么指标、自动指标是否真抓到过人类不会发现的问题——目前的回答都是「我们听样本」。
「多模态」频道最新
- ChatGPT Images 2.5 生成网页图,文字崩坏问题消失 — aitrendz_xyz · 2026-09-09
- GPT Image 2.5 草图功能:几笔乱线变四张惊艳画作 — aitrendz_xyz · 2026-09-09
- GPT Image 2.5 提示词:一张角色图变 4×4 像素战斗帧表 — aitrendz_xyz · 2026-09-09
- 用 ChatGPT Images 2.5 生成发布会总结幻灯片,文字清晰 — aitrendz_xyz · 2026-09-09
- GPT Image 2.5 提示词:单张角色图变像素待机动画 — aitrendz_xyz · 2026-09-09
- ChatGPT Images 2.5 发布:草图成图、局部编辑、文字可读 — aitrendz_xyz · 2026-09-09