Grok 4.5 终端代理基准夺冠
XFreeze · x · 2026-07-15
Grok 4.5 在 Long-Horizon Terminal-Bench 上拿到第一,超过了 Claude Fable 5、Claude Opus 4.8 和 GPT-5.6-sol。
这个基准测试的是:AI agent 能否在 长达 90 分钟、数百步依赖关系的终端操作 中持续推进任务而不丢线。作者称,在 46 个高难任务、18 个前沿模型的对比里,Grok 4.5 取得了 最高平均 reward 0.505。
帖子强调,这说明 Grok 4.5 在复杂的 agentic 工作、真实编码自动化和困难工程任务上表现更强。
所属事件:Grok 4.5 登顶终端代理基准测试(3 条相关)→
「编程与Agent」频道最新
- 从聊天到 Agent,推理延迟正在成为生产级瓶颈 — Euphoric_Sea632 · 2026-09-11
- Anthropic 研究员:99% 工程师已跑 300+ 自改进 agent 群 — AlishaOutridge · 2026-09-11
- Gergely Orosz 观察:AI Agent 提速十倍交付,却带来一堆小退化 — ducha_aiki · 2026-09-11
- 同题 Echo Maze 实测:三大模型看似成功,代码里藏着同一个 bug — eyishazyer · 2026-09-11
- Astra 分镜+Minimax H3 分镜逐帧生成,视频创作成功率大增 — Hailuo_AI · 2026-09-11
- Codex 用户实测:Sol 搭配 Astra/Luna 子代理更省额度 — pvncher · 2026-09-11