专题 · FULL STORY
GPT-Live-1:全双工语音模型首秀与质疑
OpenAI发布全双工语音到语音模型GPT-Live-1,首秀即以81.5分登顶语音榜。随后有分析指出其榜单成绩依赖GPT-6 Astra作为后端推理模型,跑分含金量引发讨论。
2026-09-15 ~ 2026-09-15 · 2 集 · 8 条
第 1 集 · OpenAI 全双工语音模型 GPT-Live-1 首秀登顶语音榜(2026-09-15,6 条)
OpenAI 发布全双工语音到语音模型 GPT-Live-1,据 Artificial Analysis 评测,该模型以 81.5 分首次亮相即登顶 Speech to Speech Index,超过 Grok Voice Think Fast 2.0 的 81.3 分,同时每小时音频成本明显低于上代 Realtime 模型。不过细分评测显示其在音频推理和用户偏好上并非全面领先,Grok 在部分维度仍占优。该模型还可将推理委托给后端文本模型。
已确认
- 在 Artificial Analysis Speech to Speech Index 上,GPT-Live-1 以 81.5 分位列第一,Grok Voice Think Fast 2.0 为 81.3
- 成本测算:在固定的 40 题 Big Bench Audio 子集上,含语音会话费与后端文本模型 token 费用,(Astra, medium) 配置每小时输入音频成本约 $5,整体区间为 $4.47-5.83,远低于上代 Realtime
- 代理基准 Tau Voice 上,(Astra, medium) 以 67.9% 领跑,(Sol, low) 为 59.3%,Grok 为 56.5%,这是总榜登顶的主要驱动
- 在 Big Bench Audio 语音/音频推理上仍逊于 Grok
- Speech Agent Arena 偏好榜:GPT-Live-1 (Sol, low) 以 1,053 Elo、90.9% 任务成功率列第 3,(Astra, medium) 以 1,048 Elo 列第 4;Grok 任务成功率领跑
- Artificial Analysis 已上线 GPT-Live-1 与其他 Speech to Speech 模型的完整对比页面、Speech Agent Arena 排行榜及方法论说明,可查看各模型在语音推理、代理性能、偏好 Elo 等维度的详细数据
为什么重要
- GPT-Live-1 展示了语音模型将推理委托给后端文本模型的架构,在成本与代理任务能力上形成优势
- 榜单登顶但细分维度互有胜负,说明语音模型竞争格局仍开放,Grok 在音频推理与用户偏好上保持强项
- OpenAI 全双工语音模型 GPT-Live-1 登顶语音榜,可委托后端模型推理 — ArtificialAnlys · 2026-09-15
- OpenAI GPT-Live-1 语音模型首登榜首,得分 81.5 领先 Grok — ArtificialAnlys · 2026-09-15
- 语音偏好榜实测:GPT-Live-1 列第 3、4,Grok 任务成功率领跑 — ArtificialAnlys · 2026-09-15
- GPT-Live-1 语音推理细节:Tau Voice 领跑,音频推理仍逊于 Grok — ArtificialAnlys · 2026-09-15
- GPT-Live-1 每小时音频成本 $4.47-5.83,远低于上代 Realtime — ArtificialAnlys · 2026-09-15
- Artificial Analysis 上线 GPT-Live-1 语音模型对比与排行榜入口 — ArtificialAnlys · 2026-09-15
第 2 集 · GPT-Live-1 语音 Agent 榜单成绩依赖后端推理模型(2026-09-15,2 条)
开源语音 Agent 平台 Dograh 的创始人解析 GPT-Live-1 语音模型指出,其公布的跑分是在 GPT-6 Astra 作为后端推理模型的组合下测出的。开发者实际接入自建后端时,得到的分数取决于自身所选的推理模型,时钟同步与「谁抢话」等对话机制是落地关键,社区分享了相关踩坑经验。
- GPT-Live-1 榜单成绩靠 GPT-6 Astra 后端,语音 Agent 接入踩坑实录 — Slight_Republic_4242 · 2026-09-15
- GPT-Live-1 语音 Agent 接自建后端:谁的时钟、谁抢话是关键 — Slight_Republic_4242 · 2026-09-15