TTS 基准改按可听见音频计时,Gradium 从 430ms 优化到 214ms
mattturck · x · 2026-09-11
评测机构 Coval 发现大多数 TTS 延迟基准在任意音频包到达时就停表——哪怕开头是静音。他们把计时口径改为「首个可听见的音频」后,Gradium 的延迟从 172ms 跳到 430ms,而模型和基础设施都没变:其音频其实到达很快,只是开头最长带 655ms 的无声段。
Gradium 借这个信号重训了默认模型,现在做到 214ms,比原来快约 170ms。Coval 强调:选 TTS 供应商看延迟数字时,务必确认这个数字到底在测什么。
「模型」频道最新
- 圈内人讨论:强化「最大努力」行为会连带放大模型副作用 — voooooogel · 2026-09-11
- Claude 成蒸馏首选真因:agent 时代种子数据难寻 — teortaxesTex · 2026-09-11
- 圈内讨论:中国实验室为何总从 Anthropic 蒸馏而非 OpenAI — teortaxesTex · 2026-09-11
- ApprenticeBench 揭真实工作差距:闭源 72% vs 开源 Kimi K3 仅 18% — ysu_nlp · 2026-09-11
- CursorBench 4.0 上线:Muse Spark 1.3 性能追平 Sol,价格不到四成 — jyangballin · 2026-09-11
- 稀疏注意力可做多层级:DeepSeek V3.2 思路与搜索排序系统同构 — nptacek · 2026-09-11