Gradium 发布最快 TTS:首段音频延迟仅约 50ms

mattturck · x · 2026-10-02

语音 AI 创业公司 Gradium 宣布其最新 Text-to-Speech 模型将首段音频延迟(TTFA)压到约 50ms,称这是前沿 TTS 模型中最低的延迟水平,并在 Speko 公开基准上拿下所有亚 100ms 模型中的自然度最高分。公司博客指出,低延迟并不以牺牲稳健性为代价:新模型在电话号码、字母数字串等困难文本上仍保持高准确率,同时自然度和表现力反而更好。Gradium 此前刚把种子轮扩展至 1 亿美元,投资方包括 NVIDIA,并在湾区开设办公室,主打实时语音 AI(TTS、STT、实时翻译、声音克隆与端侧 TTS 等)。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →