Grok 4.7 编程成绩大涨,但输出 token 用量翻倍至 81k

ArtificialAnlys · x · 2026-09-22

Artificial Analysis 发布 Grok 4.7 (xhigh) 评测:Intelligence Index 得 46 分(高于 Grok 4.6 的水平),但每任务输出 81k token,是 Grok 4.6 (xhigh) 36k 的两倍多,也远高于 Muse Spark 1.3 (max) 的 60k 和 GPT-6 Astra (max) 的 27k。

用 Grok Build(其第一方编码 agent)评测的 Coding Agent Index 从 47 升至 56,三项分项全面提升:DeepSWE v1.1 从 65% 到 73%,Terminal-Bench 4.0 从 18% 到 33%,SWE-Atlas-QnA 从 58% 到 63%。能力提升伴随明显的 token 消耗膨胀。

所属事件:Grok 4.7 评测:智能指数46分进前四,token消耗翻倍(7 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →