Grok 终端编码基准两月翻三倍超越 GPT-5.6 Sol
xAI 发布 Grok 4.7 模型卡,在 Terminal-Bench 4.0 终端/agent 编码基准上,Grok 成绩两个月内从 12.4% 涨至 38.0%,翻了三倍并超越 GPT-5.6 Sol;不过 Claude Fable 5.1 仍以 57.9% 居首。有观察者认为这种跃升不是渐进式提升。
2026-09-22 ~ 2026-09-22 · 3 条相关
- Grok 4.7 模型卡发布:Terminal-Bench 成绩从 20.3% 跳至 38.0% — ns123abc · 2026-09-22
- 两个月成绩翻三倍:Grok 登顶 Terminal-Bench 4.0 超 GPT-5.6 Sol — ns123abc · 2026-09-22
- Grok 两个月 Terminal-Bench 从 12.4% 升至 38%,超越 GPT-5.6 Sol — CurieuxExplorer · 2026-09-22