专题 · FULL STORY

OpenAI 语音模型 GPT-Live-1 上线 API

9 月 11 日,OpenAI 将 ChatGPT 的自然全双工语音对话能力以 GPT-Live-1 形式开放给 API 开发者,语音智能体可实现实时对话与推理分工。随后有分析按 $0.05/分钟计费折算其成本约 $28/M tokens,引发对定价模式的讨论。

2026-09-11 ~ 2026-09-12 · 2 集 · 39 条

第 1 集 · OpenAI 语音模型 GPT-Live-1 上线 API(2026-09-11,37 条)

9 月 11 日,OpenAI 官方宣布语音模型 GPT-Live-1 正式在 API 上线,把 ChatGPT 的自然全双工对话体验开放给开发者:语音智能体可以边说话边聆听,支持用户打断与自然来回交流,开发者还可将语音交互前端与自选的文本模型和 harness 自由组合,定价为每分钟 0.05 美元。官方同日公布生产级语音 Agent 基准成绩:在覆盖航空、零售、电信客服场景的 Tau3 测试中,与 GPT-6 Astra(中等推理力度)配对的 GPT-Live-1 首次尝试完成率达 83.6%,而 GPT-Realtime-2.1 仅为 45.7%。这是 OpenAI 首次以 API 形式开放 ChatGPT 级别的实时全双工语音能力。

已确认

  • 全双工可打断:单模型同时处理听与说,无需传统 STT→LLM→TTS 链路和脆弱的模块交接,省去多次模型交接、响应更快;用户可在模型未说完时补充细节或改话题。Greg Brockman 亦转发发布消息。
  • 噪音鲁棒性:模型能区分人声与背景噪音,官方演示咖啡厅嘈杂环境下对话不必中断。
  • 可定制性:可通过指令设定语气、节奏、表现力、语速、语言与回复长度;模型能镜像说话人语气中的情绪并自适应对方语速。
  • 架构灵活性:语音模型可作为交互前端,把任务委派给用户自选的文本模型执行,并具备可靠的工具调用能力;官方称其对话轮替(turn-taking)自然度在同类语音模型中前所未有。
  • 基准成绩:官方评测维度包括任务完成率、双向对话与话轮切换、响应速度和工具调用;Tau3 上首次尝试完成率 83.6%,对比 GPT-Realtime-2.1 的 45.7%。
  • 定价:每分钟 0.05 美元;有转发帖按 24/7 连续运行折算出每天约 72 美元的成本,供参考。
  • 实际落地:OpenAI 官方次日(9 月 12 日)介绍 Yelp 已将 GPT-Live-1 用于餐厅订位电话场景,让 AI 外呼订位更接近自然对话。
  • 早期实测:mingcalligraphy 转述一位 Reddit 用户在 API 发布当天的实测 demo——让模型以参会者身份加入真实团队会议,实时听讨论、做总结,并自动在看板上添加任务项。
  • 社区反响:开发者 muratcan 称这一发布追平了自己三个月的工作;也有评论认为这是首个真正高性能的实时语音方案。
  • 合作伙伴:Speak 披露过去几个月与 OpenAI 密切合作开发该模型并重做内部基准;Elise AI 为早期设计合作伙伴;Telnyx 作为首发伙伴提供 Python 外呼语音 Agent 教程,以 16kHz 宽带音频对比传统 G.711 约 8kHz 窄带音质;HeyGen 宣布正合作接入;TryLiveAvatar 作为发布合作伙伴联合打造演示并整体开源。

为什么重要

  • 这是 OpenAI 首次把 ChatGPT 内的实时全双工语音能力以 API 形式开放,开发者可在自己的语音 Agent 产品中获得接近真人的对话体验;Yelp 订位电话与 Reddit 用户的会议实测说明能力已可直接落地到真实工作流。
  • 语音前端与文本推理后端解耦的组合方式,意味着开发者不必锁定单一模型栈;LiveAvatar 开源 Demo 也降低了上手门槛。
  • Tau3 基准上相对前代接近翻倍的任务完成率,加上 Yelp、Speak、Telnyx、HeyGen、Elise AI 等厂商的接入动作,显示该能力可落地到电话语音 Agent、语言学习、视频生成等实际产品形态。

还有 17 条相关讨论 →

第 2 集 · GPT-Live 定价折算约 $28/M tokens,对话与推理分工明确(2026-09-12,2 条)

OpenAI 的 GPT-Live 采用 $0.05/分钟的计费方式,不按 token 计价。有分析假设 12.5Hz 音频 token 配合 chunked prefill,折算约 $28/M tokens,推测其背后可能是中型前端模型。与 GPT-Realtime 的关键区别在于,GPT-Live 只负责对话交互,推理与工具调用则委托给后端模型处理——可以是 OpenAI 的模型,也可以是用户自己的。