OpenAI 上线 GPT-Live-1 语音 API:端到端语音推理,告别拼接式语音 agent 卡顿
pbbakkum · x · 2026-09-11
OpenAI 在 API 中上线 GPT-Live-1,实时 API 团队成员 Peter Bakkum 在访谈中解释了它为何可能改变语音 agent 的游戏规则:
- 架构变化:不再串联独立的语音转文字、语言模型、文字转语音三段流水线,GPT-Live-1 把输入输出音频作为一个连续交互整体进行推理。
- 解决的实际痛点:传统方案中 VAD(语音活动检测)和轮次检测常导致语音 agent 出现尴尬停顿、误打断、上下文丢失、对背景噪音或静音误应答,显得机械。
- 交互模型:GPT-Live-1 围绕更流畅的"无轮次"(turnless)交互设计,对话感接近真人对话。
- 发帖人称过去几个月参与该 speech-to-speech API 的 alpha 测试,表示印象深刻,期待自然语音的各种集成落地。
多位开发者认为 GPT-Live 进 API 比 Gemini Astra 影响更大,因为语音 agent 的集成生态会快速铺开。
所属事件:OpenAI 推出 GPT-Live-1 语音模型,全双工对话能力开放 API(30 条相关)→
「模型」频道最新
- OpenAI 暂停 $200 ChatGPT Pro 新订阅,重度用户抱怨额度被耗尽 — MickeySteamboat · 2026-09-11
- Genspark 发布 Gen-1 Slides:价格仅 Opus 5 的 1/17 — Scobleizer · 2026-09-11
- 传 OpenAI 内部模型 Bel 攻克三大千禧年难题, hype 空前 — imadade · 2026-09-11
- DeepSeek-V4.1-Flash 上线 Ollama 云端,Pro 订阅用户已可使用 — ollama · 2026-09-11
- GPT-6 Astra 被指是计算机操作模型,专为知识工作而生 — mckbrando · 2026-09-11
- Sakana AI 发布 Fugu Max 与 Fugu Ultra v2:动态编排逼近旗舰、成本降 2-6 倍 — SakanaAILabs · 2026-09-11