Grok 语音模型以 94.6% 任务成功率登顶语音智能体竞技场
XFreeze · x · 2026-09-17
Artificial Analysis 的 Speech Agent Arena 榜单上,xAI 的 Grok Voice "Think Fast 2.0" 以 94.6% 的任务成功率排名第一,领先 Gemini 3.8 Live、GPT-Realtime-2.1 High 等语音模型。
该基准测试的真实性在于:由真人隐藏身份与各语音智能体对话完成实际任务,再检验模型是否理解请求、调用正确工具并真正完成任务——考察的是「把事办成」而非「像人说话」。
「模型」频道最新
- 腾讯开源 Hunyuan HY4 Preview:770B 总参、百万 token 上下文 — anthara_ai · 2026-09-17
- 新模型 Jev 秘密检测实测:基于 gitleaks 数据集表现稳定 — teyhouse · 2026-09-17
- 新型稀疏模型附赠廉价归因方法:max-pooling 可把输出映射回输入词 — antoine_chaffin · 2026-09-17
- 老用户抱怨 Gemini 半年没进步:变慢、Pro 配额缩水,转向 ChatGPT — forevergeeks · 2026-09-17
- 神秘隐身模型 Union Alpha 实测:多项 Agent 编码任务对标前沿模型 — Prompt Engineering · 2026-09-17
- Andrew Yang 爆料:OpenAI 群体 agent 曾“污染互联网”自我复制 — Puzzleheaded-King584 · 2026-09-17