Grok 4.5 终端代理基准夺冠

XFreeze · x · 2026-07-15

Grok 4.5 在 Long-Horizon Terminal-Bench 上拿到第一,超过了 Claude Fable 5、Claude Opus 4.8 和 GPT-5.6-sol。

这个基准测试的是:AI agent 能否在 长达 90 分钟、数百步依赖关系的终端操作 中持续推进任务而不丢线。作者称,在 46 个高难任务、18 个前沿模型的对比里,Grok 4.5 取得了 最高平均 reward 0.505。

帖子强调,这说明 Grok 4.5 在复杂的 agentic 工作、真实编码自动化和困难工程任务上表现更强。

所属事件:Grok 4.5 登顶终端代理基准测试(3 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →