GPT-Live-1 语音代理首试完成率 83.6%,远超前代 45.7%
OpenAIDevs · x · 2026-09-11
OpenAI 开发者账号公布 GPT-Live-1 在语音代理基准 Tau3 上的成绩:与 GPT-6 Astra(中等推理档)配对, airline/零售/电信客服任务首次尝试完成率 83.6%,GPT-Realtime-2.1 仅 45.7%。同一组合在需查银行文档并调用工具解决问题的 TauBanking 上得分 38.1%。对话自然度方面:在 Artificial Analysis 的 Conversational Dynamics 基准(评估何时等待、接话、应对打断、越过 "mm-hmm" 继续说)得 97.3%,并给出 Full Duplex Bench v1.5 成绩,覆盖思考停顿、打断、附和等真实通话场景。
所属事件:OpenAI 语音模型 GPT-Live-1 上线 API(22 条相关)→
「模型」频道最新
- DeepSeek V4.1 登顶 Vals 开源模型榜,每次测试仅 0.3 美元 — teortaxesTex · 2026-09-11
- 日常编码真需要旗舰模型吗?开发者和 80% 时间用中等档位 — iamaliveix · 2026-09-11
- OpenAI 平台疑似上线托管 Agents 功能:环境、模板、会话已可创建 — testingcatalog · 2026-09-11
- 30B 开源模型 OpenResearcher 在 BrowseComp-Plus 超 GPT-4.1 — TheZachMueller · 2026-09-11
- Surge 评测四大新模型:Fable 5.1 综合第一得 68.7 分 — echen · 2026-09-11
- OpenAI 暂停 200 美元/月 ChatGPT Pro 新订阅,取消后难再回来 — mark_k · 2026-09-11