OpenAI 复盘 GPT-Live:异步架构与底层重构实现毫秒级延迟
xiaohu · x · 2026-08-04
OpenAI 发布工程博客,详细复盘了最新一代全双工实时语音系统 GPT-Live 的构建过程。新系统摒弃了传统的轮流发言模式,实现了 AI 边听边说的极致低延迟体验。
核心架构升级:快慢路径分离
- 快路径(前端语音):专注于日常聊天和快速接话,在用户与语音模型间极速传递音频数据。
- 慢路径(后台大脑):遇到复杂逻辑、搜索或工具调用时,异步调用 GPT-5.5 等大模型在后台思考,完成后将结果送回前端,确保对话不中断。
底层代码与网络传输重构
- 转用 Go 语言:将媒体前端和推理逻辑从 Python 迁移至 Go 语言,大幅降低了音频数据包的延迟波动。
- 自定义 WARP 协议:基于 WebRTC 优化推出开源规范 WARP,将建立语音连接所需的 6 次网络往返缩减至 1 次(甚至单包启动),实现真正的秒连。
所属事件:OpenAI揭秘GPT-Live:重构语音栈实现毫秒级低延迟(8 条相关)→
「Infra」频道最新
- Bittensor 推出 SayGm:一个 API 密钥调用 38 个主流大模型 — bittingthembits · 2026-08-04
- MXFP8 量化下的转置难题与 NVIDIA 的折中解法 — dejavucoder · 2026-08-04
- 算力禁令或致数据中心建设放缓,光模块需求激增 — zephyr_z9 · 2026-08-04
- 极客折腾:M5 Air 32G 本地跑 300B 模型,解码达 1tps — maddie-lovelace · 2026-08-04
- 优化 GPU 调度:用 CPU 成本模型加速 Megakernel 编译 — yacineMTB · 2026-08-04
- RTX 5090实测Minimax H3:50分钟生成150万像素图像 — SourceTraining7959 · 2026-08-04