Grok 4.7 评测:能力进前四但 token 消耗翻倍引争议
Grok 4.7 于 09-22 发布并集中接受第三方评测。Artificial Analysis 给出智能指数 46 分(xhigh 推理档),比 Grok 4.6 高 2 分,xAI 首次跻身智能指数前四实验室;在多小时办公任务基准 AA-Briefcase 上以 58% 位居第二,仅比榜首 Claude Fable 5.1 Max(59%)低 1 分,领先 GPT-6 Astra。整体结论是能力显著上升但 token 消耗大幅增加:AA 口径下每任务约 81k 输出 token、单任务成本反超 Astra,不过 AA 尽调基准上成本约为 Opus 5 每任务成本的一半,性价比取决于对比对象与使用场景,引发社区争议。
已确认
- Artificial Analysis 评测:智能指数 46 分(Grok 4.6 为 44),幻觉率从 34% 降至 29%;输出速度约 188 tokens/秒,智能指数任务平均每任务约 7.1 分钟
- AA-Briefcase(多小时办公任务基准)得 1657 Elo,较 Grok 4.6 (high) +111,仅次于 Claude 系列;分析质量 Elo 升至 1994,领先 GPT-6 Astra +88 Elo;GDPval-AA 专业交付物基准领先 GPT-6 Astra +153 Elo
- AA-Briefcase 胜率上 Grok 4.7 xHigh 以 58% 位居第二,仅比榜首 Claude Fable 5.1 Max(59%)低 1 分
- AA 称在 AA-Briefcase 尽调场景中 Grok 4.7 的每任务成本约为 Opus 5 的一半
- 编程:CursorBench 4.0 得 46.3%,几乎追平 Opus 5 Max 的 46.6%;CursorBench 从 40.4% 升至 46.3%,EEBench 从 53% 升至 64%;配合 Grok Build 编程 Agent,Coding Agent Index 从 47 升至 56
- 成本与消耗:Grok 4.7 (xhigh) 每任务约消耗 81k 输出 token,是 Grok 4.6 (xhigh) 的两倍多;AA 对比中单任务成本高于 GPT-6 Astra
- 案例展示:AA-Briefcase 尽调场景中,Grok 4.7 能独立跑通逐步估值链并质疑交易伙伴的简估;另一例中它分析完整三年财报,识破汇率掩盖的增长真相,而 4.6 只用最新年度数据
- FinanceYF5 对比 Grok 4.7 与 4.6 制作的开放世界城市游戏 Demo,称 4.7 能持续工作更久、验证更充分、成品质量更好,并指出价格保持不变
尚未确认
- 用户 XFreeze 的对比数据称同一编码任务下 Grok 4.7 xHigh 输出与 Opus 5 Max 基本相当且成本不到一半、token 与步骤更少,与 AA 相对 Astra 的成本劣势并不矛盾但属个人实测口径
- 有博主用同一 prompt、最高推理档位实测:Grok 4.7 耗时 32 分钟、花费 8.14 美元完成任务,而免费的 SWE 2 仅 15 分钟、成本 0 美元,差距悬殊(个人实测)
- ChrisGPT 声称 Grok 4.8 将于 11 月底前推出,且称 Grok 4.7 单任务成本高于 GPT,属爆料性质
为什么重要
- 用户 Angaisb 与 Theo(转发)等指出,Grok 4.7 每任务 token 消耗接近 Astra 的 3 倍、比 Grok 4.6 多约 2.25 倍,「同价同速」宣传下实际使用成本可能更高,Angaisb 认为OpenAI 是唯一认真在意 token 效率的实验室;Theo 转发则称 Grok 4.7 价格不再便宜、AA 对比中成本已高于 Astra
- 有网友对比后质疑:Grok 4.7 xhigh 在 artificial arena 多耗约 2.5 倍 token 仅比前代高 2 分,智能指数涨幅的「含金量」需按性价比衡量
- 对重度 API 用户而言,xAI 新版在能力追平头部模型的同时单位成本上升,选型需按自身任务重算用量;而其在多小时 agent 任务上的分析深度提升(如三年财报与估值链案例)对专业工作场景是明确的能力增量
2026-09-22 ~ 2026-09-22 · 24 条相关
- 第 1 集:Grok 4.7 短暂现身 OpenCode Zen,疑似今日发布(2026-09-21,5 条)
- 第 2 集:xAI 发布 Grok 4.7:同价同速,编码基准大幅跃升(2026-09-21,56 条)
- 第 3 集:Grok 4.7 发布首日:开发者实测涌现,编程与生成能力获赞(2026-09-22,15 条)
- 第 4 集:Grok 4.7 评测:能力进前四但 token 消耗翻倍引争议(2026-09-22,24 条)
- 第 5 集:Grok 4.7 被指逼近顶级前沿模型,性价比成焦点(2026-09-22,2 条)
- 第 6 集:Grok 4.7 上市即有开源编辑器插件,装机超 14 万(2026-09-22,3 条)
- 第 7 集:105 个植入 bug 实测:GPT-6 拿 45 分居首,Grok 4.7 未胜前代(2026-09-22,6 条)
- 第 8 集:Grok 4.7 与小米 MiMo-V2.6 同夜发布,价格差 16 倍引热议(2026-09-22,4 条)
一手来源
- Grok 4.7 评测:智能指数 46 分进前四,token 消耗翻倍 — ArtificialAnlys ·
- 能力涨价的另一面:Grok 4.7 每任务消耗 81k token,超对手两倍 — ArtificialAnlys ·
- Artificial Analysis 实测 Grok 4.7:仅次于 Anthropic,成本约 Opus 5 一半 — ArtificialAnlys ·
- 对比称 Grok 4.7 每任务 token 用量约为 Astra 的近 3 倍 — Angaisb_ · 2026-09-22
- 【源头】Grok 4.7 评测:智能指数 46 分进前四,token 消耗翻倍 — ArtificialAnlys · 2026-09-22
- AA-Briefcase 评测:Grok 4.7 分析质量 Elo 大涨至 1994 — ArtificialAnlys · 2026-09-22
- Grok 4.7 编程 Agent 指数 47→56,三项子基准全面上升 — ArtificialAnlys · 2026-09-22
- Grok 4.7 编程成绩大涨,但输出 token 用量翻倍至 81k — ArtificialAnlys · 2026-09-22
- 【源头】能力涨价的另一面:Grok 4.7 每任务消耗 81k token,超对手两倍 — ArtificialAnlys · 2026-09-22
- Grok 4.7 输出速度实测:约 188 tokens/秒,单任务 7.1 分钟 — ArtificialAnlys · 2026-09-22
- 同题实测:Grok 4.7 花 32 分钟 8.14 美元,免费 SWE 2 仅 15 分钟 — iamfakhrealam · 2026-09-22
- Grok 4.7 幻觉率降至 29%,完整评测明细公开 — ArtificialAnlys · 2026-09-22
- 实测称 Grok 4.7 编码成本不到 Opus 5 Max 一半,效果相当 — XFreeze · 2026-09-22
- Grok 4.7 xHigh 编程基准 46.3% 追平 Opus 5 Max,成本仅一半 — XFreeze · 2026-09-22
- Grok 4.7 xHigh 距登顶仅 1 分:58% 对 Claude Fable 5.1 Max 的 59% — XFreeze · 2026-09-22
- 爆料称 Grok 4.7 已发布,单任务成本反超 GPT — ChrisGPT · 2026-09-22
- Grok 4.7 遭实测质疑:多耗 2.5 倍 token 仅高 2 分 — ivan_bezdomny · 2026-09-22
- 【源头】Artificial Analysis 实测 Grok 4.7:仅次于 Anthropic,成本约 Opus 5 一半 — ArtificialAnlys · 2026-09-22
- Grok 4.7 实测案例:能独立跑估值链并质疑交易伙伴的估算 — ArtificialAnlys · 2026-09-22
- Grok 4.7 第二例:分析三年财报,识破汇率掩盖的增长真相 — ArtificialAnlys · 2026-09-22
- Grok 4.7 编码评测大涨:CursorBench 40.4%→46.3%,价格不变 — FinanceYF5 · 2026-09-22
- Grok 4.7 价格不再便宜,第三方评测已贵过 Astra — steipete · 2026-09-22
- Grok 4.7 被指 token 效率反降 30-80%,真实成本超 4.6 一倍 — flowersslop · 2026-09-22
- Grok 4.7 专业工作评测反超 GPT-6 Astra,领先超 150 Elo — XFreeze · 2026-09-22
- Grok 4.7 单任务成本从 $1.86 涨至 $2.73,仅换来 2 分提升 — koltregaskes · 2026-09-22
- Grok 4.7 发布:AA 评测仅次 Opus 5,成本约一半 — NicoVerderosa · 2026-09-22
另有 1 条近重复转述:Angaisb_