Grok 4.7 编程成绩大涨,但输出 token 用量翻倍至 81k
ArtificialAnlys · x · 2026-09-22
Artificial Analysis 发布 Grok 4.7 (xhigh) 评测:Intelligence Index 得 46 分(高于 Grok 4.6 的水平),但每任务输出 81k token,是 Grok 4.6 (xhigh) 36k 的两倍多,也远高于 Muse Spark 1.3 (max) 的 60k 和 GPT-6 Astra (max) 的 27k。
用 Grok Build(其第一方编码 agent)评测的 Coding Agent Index 从 47 升至 56,三项分项全面提升:DeepSWE v1.1 从 65% 到 73%,Terminal-Bench 4.0 从 18% 到 33%,SWE-Atlas-QnA 从 58% 到 63%。能力提升伴随明显的 token 消耗膨胀。
所属事件:Grok 4.7 评测:智能指数46分进前四,token消耗翻倍(7 条相关)→
「模型」频道最新
- 用户抱怨 Codex 额度遭缩水式下调:还能信大厂吗 — StewartalsopIII · 2026-09-22
- 博弈论视角:抢在对手发布日前一天发模型等于自认更弱? — cocktailpeanut · 2026-09-22
- LFM2.5 端侧评测登顶:2.32GB 内存、8 秒延迟,39 款小模型中并列第一 — maximelabonne · 2026-09-22
- Jev 被指做实「张量逻辑」:让 IF 参数可微分且不浪费生成 token — StewartalsopIII · 2026-09-22
- 多语言奖励模型 Laya 登上 Hugging Face 趋势榜 — convaiinnovations · 2026-09-22
- TB 4.0 榜单:GLM-5.3、Qwen 3.8、Muse 1.3、DeepSeek v4.1 领跑 — himanshustwts · 2026-09-22