Grok 4.7 评测:能力进前四但 token 消耗翻倍引争议

Grok 4.7 于 09-22 发布并集中接受第三方评测。Artificial Analysis 给出智能指数 46 分(xhigh 推理档),比 Grok 4.6 高 2 分,xAI 首次跻身智能指数前四实验室;在多小时办公任务基准 AA-Briefcase 上以 58% 位居第二,仅比榜首 Claude Fable 5.1 Max(59%)低 1 分,领先 GPT-6 Astra。整体结论是能力显著上升但 token 消耗大幅增加:AA 口径下每任务约 81k 输出 token、单任务成本反超 Astra,不过 AA 尽调基准上成本约为 Opus 5 每任务成本的一半,性价比取决于对比对象与使用场景,引发社区争议。

已确认

尚未确认

为什么重要

2026-09-22 ~ 2026-09-22 · 24 条相关

事件全程(共 8 集)→

一手来源

另有 1 条近重复转述:Angaisb_