OpenAI 推出两款语音转写模型,实时场景更低延迟
OpenAIDevs · x · 2026-07-29
OpenAI 在 API 里推出了两款新的转写模型:
- GPT-Live-Transcribe:面向低延迟实时转写
- GPT-Transcribe:面向已完成音频文件和批处理的异步转写
官方强调这两款模型更能利用上下文,在带口音和多语言的真实音频上更准。OpenAI 还给出了上下文敏感 ASR 基准:在不提供自由文本上下文时,GPT-Live-Transcribe 的语义准确率是 38.5%,加入上下文后升到 44.6%。
另外两组结果是:
- Common Voice 22 种语言上,GPT-Live-Transcribe 的 WER 为 19.70%,优于 GPT-Realtime-Whisper-1 的 20.33%
- Real-World Audio Recording 9 种语言上,WER 为 9.60%,优于 GPT-Realtime-Whisper-1 的 11.65%
OpenAI 还建议在实时转写里提供录音背景、专有名词关键词、预期输入语言,以及前文转写片段作为上下文。
所属事件:OpenAI 发布两款语音转写新模型,性能提升且价格大降(15 条相关)→
「模型」频道最新
- vLLM 发布 Kimi K3 部署指南:支持 B300 与 MI355X — vllm_project · 2026-07-30
- vLLM 联手 Modal 实现 Kimi K3 首日支持部署 — vllm_project · 2026-07-30
- 新模型怪话观察:Opus 5等模型爱说“破坏测试” — emax · 2026-07-30
- 工程师驳斥Kimi K3内存论:小状态不代表能闪存卸载 — AccBalanced · 2026-07-30
- 开发者吐槽Claude Opus:聪明但缺乏严谨性,只爱干想干的活 — heyneighbor · 2026-07-30
- OpenAI 称 GPT-5.6 Sol 实现自我优化:服务成本降 20% — OpenAI · 2026-07-30