Grok 终端编码基准两月翻三倍超越 GPT-5.6 Sol

xAI 发布 Grok 4.7 模型卡,在 Terminal-Bench 4.0 终端/agent 编码基准上,Grok 成绩两个月内从 12.4% 涨至 38.0%,翻了三倍并超越 GPT-5.6 Sol;不过 Claude Fable 5.1 仍以 57.9% 居首。有观察者认为这种跃升不是渐进式提升。

2026-09-22 ~ 2026-09-22 · 3 条相关