Cekura 语音模型实测:2214 通电话,Phonic 延迟最低 1.59 秒

graceisford · x · 2026-09-29

Cekura 发布 speech-to-speech 基准,用同一个电话 agent、相同 prompt 和工具线,对 8 个实时语音模型跑了 82 个场景、每个场景 3 次、共 2214 通真实电话,只有三次全过的场景才算可靠。测试覆盖 OpenAI、Google、xAI、Amazon、Phonic 等,另设 cascade(级联 ASR+LLM+TTS)方案作参照。

结论方向:生产团队正从级联架构转向 speech-native 模型。注:此帖由 Phonic 一方转发,带有明显自夸立场。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →