OpenCall 用 Mercury 2.5 跑实时语音 Agent,p99 延迟降至 1 秒
StefanoErmon · x · 2026-09-09
Inception 联合创始人 Stefano Ermon 介绍 Mercury 2.5 在延迟敏感场景的落地案例:OpenCall AI 在真实患者通话上运行语音 Agent,从某 AI 推理芯片方案切换到 Mercury 后,p50 延迟降到 200ms 以下,p99 从数分钟降至 1 秒,使多步推理能塞进实时通话的延迟预算内。
Mercury 2.5 是目前最强扩散语言模型,智能较 Mercury 2 提升 40%,在 NVIDIA GPU 上跑出超 1,100 tokens/秒的速度。
所属事件:Inception 发布扩散 LLM Mercury 2.5(4 条相关)→
「模型」频道最新
- OpenAI 宣布用新一代模型智能体群解决纳维-斯托克斯千禧年难题 — _arohan_ · 2026-09-09
- OpenAI 称约一万个协作 AI 智能体 88 小时解出纳维-斯托克斯难题 — CatAstro_Piyush · 2026-09-09
- inclusionAI 开源视觉模型 Ling-3.0-flash-VL,BF16 与 FP8 权重已放出 — FellMentKE · 2026-09-09
- 网友推断:OpenAI 已开训 GPT-6.5 且评测已超 Astra — willdepue · 2026-09-09
- drama 散场后真正的问题:OpenAI「内部模型」疑似已开训 GPT-6.5 — willdepue · 2026-09-09
- 前 OpenAI 成员质疑:改写后的 ZDR 数据根本没法拿来训练 — willdepue · 2026-09-09