Grok 4.5 登顶终端代理基准测试

在测试长时程代理能力的 Terminal-Bench 基准中,Grok 4.5 表现优异夺得第一,超越了 Claude Fable 5、Claude Opus 4.8 和 GPT-5.6 等前沿模型。此前研究曾指出该基准测试对现有模型挑战极大,而 Grok 4.5 的成绩标志着 AI 在复杂 Agent 场景下的能力取得显著进展。

2026-07-14 ~ 2026-07-15 · 3 条相关