Gemini 3.1 Flash Live 登顶语音 Agent 竞技场,人类盲测更爱它
_philschmid · x · 2026-08-22
Artificial Analysis 推出新的 Speech Agent Arena 语音 Agent 盲测排行榜,让模型在预约牙医、点外卖等真实语音对话中被人类偏好比较。Google Gemini 3.1 Flash Live Preview(Minimal)以 Elo 1046 排名第一,任务成功率 74.6%;High 版本排第二(Elo 1014)。
OpenAI 的 GPT-Realtime-1.5 以 85.1% 的任务成功率高居实用性第一(Elo 1000 排第三),ElevenLabs Agents 任务成功率也达 90.5%。Amazon Nova 2.0 Sonic、Grok Voice、Qwen3.5 Omni 等均进入榜单,其中 Qwen3.5 Omni Flash 任务成功率仅 29.1%。
所属事件:Speech Agent Arena上线,Gemini语音模型领跑盲测榜(3 条相关)→
「模型」频道最新
- Qwen 3.8 低推理模式实测:循环次数显著减少 — Lair98 · 2026-08-22
- GLM-5.3 摘得创意写作基准亚军,定性分析报告发布 — zero0_one1 · 2026-08-22
- 私下基准测试:0x Alpha 低推理配置表现不佳 — toptickcrypto · 2026-08-22
- Ox Alpha 模型实测:代码与数据分析能力超预期 — killerbee1432 · 2026-08-22
- Qwen3.8-27B 优化:长上下文解码提速 3 倍 — stargate425 · 2026-08-22
- Grok 4.6 登顶 CursorBench,成本仅为竞品 1/6 — XFreeze · 2026-08-22