两个月成绩翻三倍:Grok 登顶 Terminal-Bench 4.0 超 GPT-5.6 Sol
ns123abc · x · 2026-09-22
据推文,Grok 在 Terminal-Bench 4.0(终端/agent 编码基准)上的成绩在两个月内从 12.4% 涨到 38.0%,翻了三倍,并超越了 GPT-5.6 Sol。若数据属实,这是 xAI 模型在 agent 编码任务上进步速度的又一例证。
所属事件:Grok 4.7 登顶 Terminal-Bench 4.0 两个月成绩翻三倍(2 条相关)→
「模型」频道最新
- Grok 九周连发三版:4.5 到 4.7 迭代节奏惊人 — XFreeze · 2026-09-22
- 曝 OpenAI 赶造 Codex Bot 对标 Grok Bot,并发文谈递归自我改进 — dotey · 2026-09-22
- 工程师用 Agent 集群 20 小时自主训出对标 Jev 的模型,总花费仅 3100 美元 — denisyarats · 2026-09-22
- 博主发起挑战:记录每日 token 消耗,验证 AI 公司是否暗中降限额 — tomchapin · 2026-09-22
- Grok 4.7 上手首日:严格遵循 system prompt,实测优于 4.5 — elonmusk · 2026-09-22
- MoVA 新架构:稀疏值专家提升注意力容量且不增 KV 缓存 — rupspace · 2026-09-22