Grok 4.7 编程 Agent 指数 47→56,三项子基准全面上升
ArtificialAnlys · x · 2026-09-22
Artificial Analysis 补充 Grok 4.7 编程能力细节:配合自家 Grok Build 编程 Agent,Grok 4.7 (xhigh) 在 Coding Agent Index 得分 56,较 Grok 4.6 (xhigh) 的 47 提升 9 分,三个组成部分均改善——DeepSWE v1.1 从 65% 升至 73%,Terminal-Bench 4.0 从 18% 升至 33%,SWE-Atlas-QnA 从 58% 升至 63%。该评测使用 xAI 第一方 harness,与 Intelligence Index 的标准化跨模型评测分开。
所属事件:Grok 4.7 评测:智能指数46分进前四,token消耗翻倍(7 条相关)→
「模型」频道最新
- Grok 4.7 又翻车:花 $1.59 输出惨不忍睹,遭全网围观 — teortaxesTex · 2026-09-22
- 实测打脸:1000 条诈骗广告分类,拟合 TF-IDF 基线完胜 LLM — justinbiebar · 2026-09-22
- Evo 2 模型内部竟编码「生命之树」:激活流形对应物种演化关系 — burny_tech · 2026-09-22
- 内部实测:Grok 4.7 在 22 项知识工作中排第 3,成本低于 5 美元 — realsohamparekh · 2026-09-22
- Codex 代码泄露 GPT-6 Luna:已内置定价,疑似与 Sol 同期发布 — haider1 · 2026-09-22
- Alex Atallah:专用小模型涌现,Jev 时刻或重塑 AI 生态 — multiply_matrix · 2026-09-22