Terminal-Bench 上的长程 Agent 进展
tetsuoai · x · 2026-07-14
帖子在对比 Terminal-Bench 的长时程 agent 表现:
- 早前论文结论认为该基准仍有很大提升空间:15 个模型里最好只完成 46 个任务中的 7 个,平均大约 2 个。
- 现在作者声称 Grok 4.5 已做到 13 个任务,Fable 5 做到 12 个,意味着两个月内 agent 的长程执行能力显著提升。
- 还给出成本与执行特征:单个任务约耗 990 万 tokens、231 个 episodes、85 分钟墙钟时间。
- 作者分析:Grok 4.5 的“4.2x 输出 token 效率”其实低估了收益,因为这类 benchmark 的主要成本在于输入重放;如果模型用更少步骤完成任务,累积上下文更少,整体输入成本会明显下降。
- 末尾推测 Grok 4.5 的提升可能来自与 Cursor 相关的训练数据,即大量真实的 agentic 编辑轨迹。
所属事件:Grok 4.5 登顶终端代理基准测试(3 条相关)→
「编程与Agent」频道最新
- 模型之外才是关键:一文拆解 RAG 到多智能体的六大 AI 架构 — goyalshaliniuk · 2026-09-11
- 零基础开发者自建分层记忆架构,仅 20k token 记住一年对话 — matteoianni · 2026-09-11
- Warp 六个非工程团队全用 Linear 和 Claude Code 工程化运作 — mon__lim · 2026-09-11
- 九年后端老兵:AI 代码不比人写的差,变糟的只是速率 — Sweaty-Landscape-561 · 2026-09-11
- 实测质疑 RTK 省 token 说法:成本基准显示并不成立 — michalwarda · 2026-09-11
- 从聊天到 Agent,推理延迟正在成为生产级瓶颈 — Euphoric_Sea632 · 2026-09-11