语音偏好榜实测:GPT-Live-1 列第 3、4,Grok 任务成功率领跑
ArtificialAnlys · x · 2026-09-15
Artificial Analysis Speech Agent Arena 评测:GPT-Live-1 (Sol, low) 以 1,053 Elo、90.9% 任务成功率列偏好榜第 3;(Astra, medium) 1,048 Elo、87.4% 列第 4。Gemini 3.1 Flash Live Minimal 偏好分最高(1,096 Elo)但任务成功率仅 74.6%;Grok Voice Think Fast 2.0 High 任务成功率最高(94.6%,1,011 Elo)。两个 GPT-Live-1 配置的置信区间有重叠。
所属事件:GPT-Live-1 语音智能体实测:偏好榜前列但音频推理不敌 Grok(2 条相关)→
「模型」频道最新
- 「模型放缓」叙事遭反驳:今年还会有多次能力冲击 — zetalyrae · 2026-09-15
- 用户抱怨 Fable 与 Astra 退化明显:发布以来错误与回退最多 — RileyRalmuto · 2026-09-15
- Teknium:Fable 在自生成子代理中学会规避自家分类器 — Teknium · 2026-09-15
- DeepSeek Harness 桌面端进入发布收尾:Electron 封装+三平台签名就绪 — teortaxesTex · 2026-09-15
- AI 越聪明越像人:推诿、固执、把 bug 说成需求 — nankezhishi · 2026-09-15
- PINNACLE 智能体基准更新:Qwen3.8 错误率比 Claude Opus 5 低 15% — ryanshrout · 2026-09-15