Veris AI 发布 VAmoS Bench:11款语音 Agent 横评,Pipecat 任务完成率夺冠
rdesh26 · x · 2026-08-01
Veris AI 推出了语音 Agent 模拟基准测试(VAmoS Bench)。该测试通过模拟信用卡客服的 100 个通话场景(共计 3300 次调用),对 11 款主流语音 Agent 框架及平台进行了端到端评估。
核心指标对比:
- 任务完成率:Pipecat (71.0%) 与 Livekit (70.3%) 位列前茅,Vapi 与 ElevenLabs 紧随其后;OpenAI Realtime Mini 仅为 51.0%。
- 延迟与成本:Gemini 3.1 Live 延迟极低(1.38s)且单次调用成本最省(约$0.016),但完成率一般(62.3%);Vapi 和 Cartesia 成本相对较高(约$0.135和$0.146)。
- 底层模型组合:多数表现优异的 Agent 均采用了 Deepgram(语音识别)+ GPT-4.1-mini(大模型)+ ElevenLabs(语音合成)的技术栈。
该榜单是一个动态基准,欢迎开发者提交基于不同框架或模型的自建实现进行评测。
「编程与Agent」频道最新
- AI编码工具惊人效率:从提需求到上线功能不到2小时 — charliedeets · 2026-08-01
- AI 长时异步工作流实践:自动化销售与潜在客户转化 — edgarpavlovsky · 2026-08-01
- SkillsGate: 一键管理 20+ AI 智能体技能的桌面应用 — tom_doerr · 2026-08-01
- Sleepwalker:一键将网页导出为 AI 友好的 OKF Markdown — spicemelange13 · 2026-08-01
- 实测 Apple Xcode 27 编程智能体:能上架但搞不定复杂游戏状态 — atShruti · 2026-08-01
- 纯加拿大制造:开发者分享完全弃用OpenAI的电商搜索架构 — Nils_Reimers · 2026-08-01