AA-Briefcase 评测:Grok 4.7 分析质量 Elo 大涨至 1994

ArtificialAnlys · x · 2026-09-22

Artificial Analysis 补充 Grok 4.7 在 agent 知识工作基准的细分数据:AA-Briefcase(模拟真实职业任务)得分 1657 Elo,较 Grok 4.6 (high) +111,仅次于 Claude Opus 5 和 Claude Fable 5.1。提升主要来自分析质量:分析质量 Elo 1994(上代 1690),呈现质量 1499(上代 1519)。该基准还检查交付物是否满足任务要求。在 GDPval-AA(要求产出文档、表格、幻灯片等实际工作成果)上得分 1695,上代为 1605。

所属事件:Grok 4.7 评测:智能指数46分进前四,token消耗翻倍(7 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →