Cekura 语音模型实测:2214 通电话,Phonic 延迟最低 1.59 秒
graceisford · x · 2026-09-29
Cekura 发布 speech-to-speech 基准,用同一个电话 agent、相同 prompt 和工具线,对 8 个实时语音模型跑了 82 个场景、每个场景 3 次、共 2214 通真实电话,只有三次全过的场景才算可靠。测试覆盖 OpenAI、Google、xAI、Amazon、Phonic 等,另设 cascade(级联 ASR+LLM+TTS)方案作参照。
- GPT Realtime 2.1 最可靠:82 个场景中 65 个三次全过
- Phonic v1 延迟最低:1.59 秒应答
- 工作流包括诊所预约和较长的 Medicare 信息录入,要求达到正确结果并正确保存信息
结论方向:生产团队正从级联架构转向 speech-native 模型。注:此帖由 Phonic 一方转发,带有明显自夸立场。
「编程与Agent」频道最新
- Opus 5.5 登 Agent Arena 第二,成本降 40-56% 重画性价比前沿 — arena · 2026-09-29
- JupyterLite WebMCP:agent 直连浏览器内 notebook,实时改格跑代码 — OpenAIDevs · 2026-09-29
- Faraday 让 agent 经 WebMCP 浏览 3D 扫描,数据不出浏览器 — OpenAIDevs · 2026-09-29
- WebMCP 项目 Observatory:人与浏览器 Agent 共绘可编辑奇幻地图 — OpenAIDevs · 2026-09-29
- Mandate 探索临时授权:让 agent 权限像口头委托一样自动过期 — OpenAIDevs · 2026-09-29
- WebMCP 项目 ArchMorph:与 Agent 共同设计住宅并 3D 走逛 — OpenAIDevs · 2026-09-29