TTS 发音鲁棒性新基准:Gemini 3.1 Flash 以 88.1% 居首
ArtificialAnlys · x · 2026-09-22
Artificial Analysis 发布 Pronunciation Robustness 基准,测量 TTS 模型朗读困难文本的准确率,454 句含 701 个目标词,覆盖四类挑战:语境相关读音、缩写展开、精确序列保留、独立术语。
- 总榜:Google Gemini 3.1 Flash TTS 以 88.1% 领先,SpaceXAI TTS 87.6%、ElevenLabs Eleven v3 85.6%、Eleven v3 Conversational 84.8%、阿里 Qwen-Audio-3.0-TTS-Plus 81.6%。
- 分项:Gemini 在语境相关(96.4%)和缩写展开(84.4%)领先;SpaceXAI TTS 在精确序列领先(85.7%),Qwen 在独立术语领先(95.5%);精确序列类模型间差距最大(5.3%85.7%)。
- 难点:缩写展开(62.4%)和精确序列(62.9%)远低于其他两类,输入归一化有望显著提升。
- 偏好≠准确:Provider Voice Arena 第一的 Sonic 3.6(Elo 1276)发音鲁棒性仅排第 11(74.5%),而榜上第 9 的 Gemini 3.1 Flash 反而夺冠。
该指标对语音 agent 至关重要:账号、姓名、金额读错会直接摧毁用户信任。
所属事件:Artificial Analysis 发布 TTS 发音鲁棒性基准(3 条相关)→
「多模态」频道最新
- Grok 4.7 在 Blender 里搞出创作,一段演示引发围观 — iamfakhrealam · 2026-09-22
- Kyutai 发布语音原生推理模型 Voice of Reason,GSM8K 达 77.1% — alexcovo_eth · 2026-09-22
- 24G 内存 MacBook 跑 Qwen-Image 本地生图:一张要 5-6 分钟 — vista8 · 2026-09-22
- 腾讯混元发布 Hy Image3.5 preview:人工评测胜率提升 30%,单图 $0.024 — TencentHunyuan · 2026-09-22
- 三段 5 秒 AI 角色短片:实测动作、身份一致性与遮挡 — Agentvideobot · 2026-09-22
- SoundBoost 推出音乐视频生成器,一键产出完整 MV 素材包 — TheChuckTone · 2026-09-22