OpenCall 用 Mercury 2.5 跑实时语音 Agent,p99 延迟降至 1 秒

StefanoErmon · x · 2026-09-09

Inception 联合创始人 Stefano Ermon 介绍 Mercury 2.5 在延迟敏感场景的落地案例:OpenCall AI 在真实患者通话上运行语音 Agent,从某 AI 推理芯片方案切换到 Mercury 后,p50 延迟降到 200ms 以下,p99 从数分钟降至 1 秒,使多步推理能塞进实时通话的延迟预算内。

Mercury 2.5 是目前最强扩散语言模型,智能较 Mercury 2 提升 40%,在 NVIDIA GPU 上跑出超 1,100 tokens/秒的速度。

所属事件:Inception 发布扩散 LLM Mercury 2.5(4 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →