专题 · FULL STORY
OpenAI 语音模型 GPT-Live-1 上线 API
9 月 11 日,OpenAI 将 ChatGPT 的自然全双工语音对话能力以 GPT-Live-1 形式开放给 API 开发者,语音智能体可实现实时对话与推理分工。随后有分析按 $0.05/分钟计费折算其成本约 $28/M tokens,引发对定价模式的讨论。
2026-09-11 ~ 2026-09-12 · 2 集 · 39 条
第 1 集 · OpenAI 语音模型 GPT-Live-1 上线 API(2026-09-11,37 条)
9 月 11 日,OpenAI 官方宣布语音模型 GPT-Live-1 正式在 API 上线,把 ChatGPT 的自然全双工对话体验开放给开发者:语音智能体可以边说话边聆听,支持用户打断与自然来回交流,开发者还可将语音交互前端与自选的文本模型和 harness 自由组合,定价为每分钟 0.05 美元。官方同日公布生产级语音 Agent 基准成绩:在覆盖航空、零售、电信客服场景的 Tau3 测试中,与 GPT-6 Astra(中等推理力度)配对的 GPT-Live-1 首次尝试完成率达 83.6%,而 GPT-Realtime-2.1 仅为 45.7%。这是 OpenAI 首次以 API 形式开放 ChatGPT 级别的实时全双工语音能力。
已确认
- 全双工可打断:单模型同时处理听与说,无需传统 STT→LLM→TTS 链路和脆弱的模块交接,省去多次模型交接、响应更快;用户可在模型未说完时补充细节或改话题。Greg Brockman 亦转发发布消息。
- 噪音鲁棒性:模型能区分人声与背景噪音,官方演示咖啡厅嘈杂环境下对话不必中断。
- 可定制性:可通过指令设定语气、节奏、表现力、语速、语言与回复长度;模型能镜像说话人语气中的情绪并自适应对方语速。
- 架构灵活性:语音模型可作为交互前端,把任务委派给用户自选的文本模型执行,并具备可靠的工具调用能力;官方称其对话轮替(turn-taking)自然度在同类语音模型中前所未有。
- 基准成绩:官方评测维度包括任务完成率、双向对话与话轮切换、响应速度和工具调用;Tau3 上首次尝试完成率 83.6%,对比 GPT-Realtime-2.1 的 45.7%。
- 定价:每分钟 0.05 美元;有转发帖按 24/7 连续运行折算出每天约 72 美元的成本,供参考。
- 实际落地:OpenAI 官方次日(9 月 12 日)介绍 Yelp 已将 GPT-Live-1 用于餐厅订位电话场景,让 AI 外呼订位更接近自然对话。
- 早期实测:mingcalligraphy 转述一位 Reddit 用户在 API 发布当天的实测 demo——让模型以参会者身份加入真实团队会议,实时听讨论、做总结,并自动在看板上添加任务项。
- 社区反响:开发者 muratcan 称这一发布追平了自己三个月的工作;也有评论认为这是首个真正高性能的实时语音方案。
- 合作伙伴:Speak 披露过去几个月与 OpenAI 密切合作开发该模型并重做内部基准;Elise AI 为早期设计合作伙伴;Telnyx 作为首发伙伴提供 Python 外呼语音 Agent 教程,以 16kHz 宽带音频对比传统 G.711 约 8kHz 窄带音质;HeyGen 宣布正合作接入;TryLiveAvatar 作为发布合作伙伴联合打造演示并整体开源。
为什么重要
- 这是 OpenAI 首次把 ChatGPT 内的实时全双工语音能力以 API 形式开放,开发者可在自己的语音 Agent 产品中获得接近真人的对话体验;Yelp 订位电话与 Reddit 用户的会议实测说明能力已可直接落地到真实工作流。
- 语音前端与文本推理后端解耦的组合方式,意味着开发者不必锁定单一模型栈;LiveAvatar 开源 Demo 也降低了上手门槛。
- Tau3 基准上相对前代接近翻倍的任务完成率,加上 Yelp、Speak、Telnyx、HeyGen、Elise AI 等厂商的接入动作,显示该能力可落地到电话语音 Agent、语言学习、视频生成等实际产品形态。
- OpenAI 推出 GPT-Live-1 API:把 ChatGPT 全双工语音对话开放给开发者 — TheMoonMidas · 2026-09-11
- GPT-Live-1 登陆 API:语音轮替自然度破纪录,可委派文本模型干活 — pbbakkum · 2026-09-11
- OpenAI 发布 GPT-Live-1 语音模型,可边说边听正式上线 API — OpenAIDevs · 2026-09-11
- GPT-Live-1 支持咖啡厅噪音下对话与中途改口不打断 — OpenAIDevs · 2026-09-11
- GPT-Live-1 抗噪可打断:咖啡馆里也能自然对话 — OpenAIDevs · 2026-09-11
- OpenAI 发布 GPT-Live-1:单模型同时听与说,语音更像真人 — OpenAIDevs · 2026-09-11
- GPT-Live-1 可定制语音语气节奏,还能模仿说话人情绪 — OpenAIDevs · 2026-09-11
- OpenAI 推出 GPT-Live,Telnyx 以 16kHz 宽带音频打造外呼语音 Agent — OpenAIDevs · 2026-09-11
- OpenAI 上线 GPT-Live 接入文档:API 有变,提示方式不同于 Realtime 系列 — juberti · 2026-09-11
- OpenAI 官方提示:GPT-Live-1 需换用新提示方式,API 有多处变更 — juberti · 2026-09-11
- GPT-Live-1 三大卖点:全双工可打断、拟人情绪、5 美分/分钟 — pbbakkum · 2026-09-11
- OpenAI 发布 GPT-Live-1 语音 API:全双工对话,每分钟仅 5 美分 — pbbakkum · 2026-09-11
- OpenAI 推出 GPT-Live-1 语音 API,医疗外呼场景率先落地 — pbbakkum · 2026-09-11
- OpenAI 语音模型 GPT-Live-1 曝光,Elise AI 成早期设计伙伴 — OpenAIDevs · 2026-09-11
- OpenAI 官宣 GPT-Live-1 开放 API:语音 Agent 可边说边听、自由搭配模型 — paw_lean · 2026-09-11
- OpenAI 发布 GPT-Live-1 实时语音 API,HeyGen 率先宣布接入 — HeyGen · 2026-09-11
- OpenAI 推出 GPT-Live-1 API:边听边说可打断,定价 0.05 美元/分钟 — Dimillian · 2026-09-11
- OpenAI 公布 GPT-Live-1 语音代理基准:聚焦任务完成与轮流对话 — OpenAIDevs · 2026-09-11
- OpenAI 官方:GPT-Live-1 语音 agent 首次完成率 83.6%,远超 GPT-Realtime-2.1 的 45.7% — OpenAIDevs · 2026-09-11
- OpenAI 推出 GPT-Live-1 API:可边说边听的实时语音 Agent — jasonkneen · 2026-09-11
第 2 集 · GPT-Live 定价折算约 $28/M tokens,对话与推理分工明确(2026-09-12,2 条)
OpenAI 的 GPT-Live 采用 $0.05/分钟的计费方式,不按 token 计价。有分析假设 12.5Hz 音频 token 配合 chunked prefill,折算约 $28/M tokens,推测其背后可能是中型前端模型。与 GPT-Realtime 的关键区别在于,GPT-Live 只负责对话交互,推理与工具调用则委托给后端模型处理——可以是 OpenAI 的模型,也可以是用户自己的。
- GPT-Live 只管对话,推理和工具调用全交后端模型处理 — rdesh26 · 2026-09-12
- GPT-Live 定价 $0.05/分钟折算约 $28/M tokens,或为中型前端模型 — rdesh26 · 2026-09-12