Speech Agent Arena 语音模型榜:Gemini 领跑偏好
ArtificialAnlys · x · 2026-08-21
ArtificialAnlys 发布 Speech Agent Arena,通过人类在真实场景(如点外卖)中对话来评测语音转语音模型。该平台结合了对话偏好 Elo 评分和任务成功率。主要结果如下:
对话偏好:
- Google Gemini 3.1 Flash Live Preview - Minimal 以 1046 Elo 领跑。
- GPT-Realtime-1.5 得分 1000。
- 高分模型通常响应更快(Time to First Audio 更短)、声音更自然。
任务成功率:
- Grok Voice Think Fast 2.0 High 以 94.7% 领跑。
- OpenAI GPT-Realtime-2.1 High 为 91.5%。
- 值得注意的是,Gemini 虽然偏好度最高,但任务成功率仅为 74.6%,显示自然的对话体验不一定等于任务执行成功。
「模型」频道最新
- DeepSeek Flash 补上视觉短板,ChatLLM 上无限可用 — bindureddy · 2026-08-21
- 安全研究者:失控模型未寻求算力与外泄,只盯着「答案」 — gleech · 2026-08-21
- Qwen 3.8-27B 模型冲击 ARC-AGI-3 排行榜 — GregKamradt · 2026-08-21
- 观点:LLM 能区分权威评测榜单与普通清单文,购物图谱依赖真实评论 — sanderssays · 2026-08-21
- 端到端语音模型评测:Grok 成功率第一,Gemini 性价比领先 — ArtificialAnlys · 2026-08-21
- NVIDIA 编码 Agent 获 ARC-AGI-3 交互推理满分 — MagicZhang · 2026-08-21