Grok 4.5 登顶终端代理基准测试
在测试长时程代理能力的 Terminal-Bench 基准中,Grok 4.5 表现优异夺得第一,超越了 Claude Fable 5、Claude Opus 4.8 和 GPT-5.6 等前沿模型。此前研究曾指出该基准测试对现有模型挑战极大,而 Grok 4.5 的成绩标志着 AI 在复杂 Agent 场景下的能力取得显著进展。
2026-07-14 ~ 2026-07-15 · 3 条相关
- Terminal-Bench 上的长程 Agent 进展 — tetsuoai · 2026-07-14
- GPT-5.6在Agent评测领先 — RajmaChawala · 2026-07-14
- Grok 4.5 终端代理基准夺冠 — XFreeze · 2026-07-15