Grok 4.7 评测:智能指数46分进前四,token消耗翻倍
Artificial Analysis 于 9 月 22 日发布 Grok 4.7 (xhigh) 系列评测:智能指数得 46 分,比 Grok 4.6 高 2 分,xAI 首次跻身智能指数前四实验室。能力显著提升的同时,token 消耗也翻倍,每任务输出约 81k token,约是对手模型的两倍。
已确认
- 智能指数:Grok 4.7 (xhigh) 得 46 分,比 Grok 4.6 高 2 分,xAI 首次进入智能指数前四实验室行列。
- 编程能力:配合 xAI 自家 Grok Build 编程 Agent,Grok 4.7 (xhigh) 在 Coding Agent Index 得 56 分,较 Grok 4.6 的 47 分大幅上升,三项子基准全面提高。
- 知识问答:AA-Omniscience 子项中幻觉率从 34% 降至 29%,完整评测明细已公开。
- Agent 知识工作:AA-Briefcase(模拟真实职业任务)得 1657 Elo,较 Grok 4.6 (high) 提升 111,仅次于 Claude 系列模型。
- 性能实测:长提示词下输出速度约 188 tokens/秒,智能指数任务平均每任务耗时约 7.1 分钟。
- 代价:每任务约消耗 81k 输出 token,是 Grok 4.6 (xhigh) 的两倍,也超过其他对手约两倍。
为什么重要
- Grok 4.7 让 xAI 首次进入智能指数前四,标志其跻身第一梯队实验室。
- 但成绩提升伴随高昂 token 成本,Artificial Analysis 特别指出这一「能力涨价」的代价,对实际部署的成本效益评估具有重要参考意义。
2026-09-22 ~ 2026-09-22 · 7 条相关
一手来源
- Grok 4.7 评测:智能指数 46 分进前四,token 消耗翻倍 — ArtificialAnlys ·
- 能力涨价的另一面:Grok 4.7 每任务消耗 81k token,超对手两倍 — ArtificialAnlys ·
- Grok 4.7 编程 Agent 指数 47→56,三项子基准全面上升 — ArtificialAnlys ·
- 【源头】Grok 4.7 评测:智能指数 46 分进前四,token 消耗翻倍 — ArtificialAnlys · 2026-09-22
- AA-Briefcase 评测:Grok 4.7 分析质量 Elo 大涨至 1994 — ArtificialAnlys · 2026-09-22
- 【源头】Grok 4.7 编程 Agent 指数 47→56,三项子基准全面上升 — ArtificialAnlys · 2026-09-22
- Grok 4.7 编程成绩大涨,但输出 token 用量翻倍至 81k — ArtificialAnlys · 2026-09-22
- 【源头】能力涨价的另一面:Grok 4.7 每任务消耗 81k token,超对手两倍 — ArtificialAnlys · 2026-09-22
- Grok 4.7 输出速度实测:约 188 tokens/秒,单任务 7.1 分钟 — ArtificialAnlys · 2026-09-22
- Grok 4.7 幻觉率降至 29%,完整评测明细公开 — ArtificialAnlys · 2026-09-22