TTS 基准改按可听见音频计时,Gradium 从 430ms 优化到 214ms

mattturck · x · 2026-09-11

评测机构 Coval 发现大多数 TTS 延迟基准在任意音频包到达时就停表——哪怕开头是静音。他们把计时口径改为「首个可听见的音频」后,Gradium 的延迟从 172ms 跳到 430ms,而模型和基础设施都没变:其音频其实到达很快,只是开头最长带 655ms 的无声段。

Gradium 借这个信号重训了默认模型,现在做到 214ms,比原来快约 170ms。Coval 强调:选 TTS 供应商看延迟数字时,务必确认这个数字到底在测什么。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →