AA-Briefcase 评测:Grok 4.7 分析质量 Elo 大涨至 1994
ArtificialAnlys · x · 2026-09-22
Artificial Analysis 补充 Grok 4.7 在 agent 知识工作基准的细分数据:AA-Briefcase(模拟真实职业任务)得分 1657 Elo,较 Grok 4.6 (high) +111,仅次于 Claude Opus 5 和 Claude Fable 5.1。提升主要来自分析质量:分析质量 Elo 1994(上代 1690),呈现质量 1499(上代 1519)。该基准还检查交付物是否满足任务要求。在 GDPval-AA(要求产出文档、表格、幻灯片等实际工作成果)上得分 1695,上代为 1605。
所属事件:Grok 4.7 评测:智能指数46分进前四,token消耗翻倍(7 条相关)→
「模型」频道最新
- Azure OpenAI 内容过滤器闹乌龙:把「S&M」当成色情内容拦截 — peterjliu · 2026-09-22
- IFM 发布 K2-Horizon-36B-A4B:MoVA 新架构以 4B 激活参数对标大 20 倍模型 — victormustar · 2026-09-22
- Grok 4.7 又翻车:花 $1.59 输出惨不忍睹,遭全网围观 — teortaxesTex · 2026-09-22
- 实测打脸:1000 条诈骗广告分类,拟合 TF-IDF 基线完胜 LLM — justinbiebar · 2026-09-22
- Evo 2 模型内部竟编码「生命之树」:激活流形对应物种演化关系 — burny_tech · 2026-09-22
- 内部实测:Grok 4.7 在 22 项知识工作中排第 3,成本低于 5 美元 — realsohamparekh · 2026-09-22