Grok 语音模型登顶新基准,任务成功率第一
XFreeze · x · 2026-08-22
Grok Voice Think Fast 2.0 在 Artificial Analysis 新推出的 Speech Agent Arena 排行中位列第一,该基准通过真人与隐藏语音代理在实用场景下的交互来衡量任务成功率。这不仅仅考察语音自然度,更看重 AI 理解请求、调用工具并成功完成工作的实际能力。
所属事件:Speech Agent Arena 上线,Grok 与 Gemini 各领风骚(4 条相关)→
「模型」频道最新
- Opus 5 技能点侧重编程与哲学,意图理解能力突出 — davidad · 2026-08-22
- Fable 5 博士级数学能力显著,Anthropic 传统弱势逆转 — davidad · 2026-08-22
- 对比:2025 年模型与现在的“不可名状”对话风格 — almmaasoglu · 2026-08-22
- 测试员实测 Opus 5:关掉思考模式虽易翻车但更快 — davidad · 2026-08-22
- 探讨 Fable 与 Opus 5 的科学与数学能力差异 — repligate · 2026-08-22
- V4-0813 数学最强,Flash-0731 擅长数据分析 — teortaxesTex · 2026-08-22