Terminal-Bench: Benchmarking Agents on Hard, Realistic Tasks in Command Line Interfaces
Mike A. Merrill, Alexander G. Shaw, Nicholas Carlini, Boxuan Li, Harsh Raj, Ivan Bercovich, Lin Shi, Jeong Yeon Shin, Thomas Walshe, E. Kelly Buchanan, Junhong Shen, Guanghao Ye, Haowei Lin, Jason Poulos, Maoyu Wang, Marianna Nezhurina, Jenia Jitsev, Di Lu, Orfeas Menis Mastromichalakis, Zhiwei Xu, Zizhao Chen, Yue Liu, Robert Zhang, Leon Liangyu Chen, Anurag Kashyap, Jan-Lucas Uslu, Jeffrey Li, Jianbo Wu, Minghao Yan, Song Bian, Vedang Sharma, Ke Sun, Steven Dillmann, Akshay Anand, Andrew Lanpouthakoun, Bardia Koopah, Changran Hu, Etash Guha, Gabriel H. S. Dreiman, Jiacheng Zhu, Karl Krauth, Li Zhong, Niklas Muennighoff, Robert Amanfu, Shangyin Tan, Shreyas Pimpalgaonkar, Tushar Aggarwal, Xiangning Lin, Xin Lan, Xuandong Zhao, Yiqing Liang, Yuanli Wang, Zilong Wang, Changzhi Zhou, David Heineman, Hange Liu, Harsh Trivedi, John Yang, Junhong Lin, Manish Shetty, Michael Yang, Nabil Omi, Negin Raoof, Shanda Li, Terry Yue Zhuo, Wuwei Lin, Yiwei Dai, Yuxin Wang, Wenhao Chai, Shang Zhou, Dariush Wahdany, Ziyu She, Jiaming Hu, Zhikang Dong, Yuxuan Zhu, Sasha Cui, Ahson Saiyed, Arinbjörn Kolbeinsson, Jesse Hu, Christopher Michael Rytting, Ryan Marten, Yixin Wang, Alex Dimakis, Andy Konwinski, Ludwig Schmidt
cs.SE, cs.AI
2026-01-17
斯坦福等发布Terminal-Bench 2.0:89道经人工三审的真实终端任务,GPT-5.2配Codex CLI最高63%,开源最佳36%,部分任务仍无人解出。
现有 agent 评测卡在两头。一类环境是合成的,离真实工作流太远;一类任务已经不够难,前沿模型刷分没有区分度。终端把这两头接上了:它是文本界面,天然适合语言模型,同时又是软件工程、科学计算、安全、机器学习收费工作真正发生的地方。Cursor、Codex CLI、Claude Code、Gemini CLI 都靠往 shell 发命令工作。Anthropic 在文中引用的数字是,Claude Code 做到约 10 亿美元年化收入。
缺的是一套既难、又像真活、结果还能自动判对错的考卷。Terminal-Bench 把任务放进真实 Docker 容器的命令行,测配置遗留系统、复现论文、修编译器、把 COBOL 重写成 Python 这类专业活。
一条任务四件套:自然语言指令、Docker 镜像、验收测试、人手写的 oracle 解答,外加时限。测试只看最终容器状态,不看命令轨迹。路径随便选,终点必须对。不同脚手架(agent 外面包的工具循环与提示)因此能在同一套题上比。
任务按 Harbor 格式写。Harbor 是配套评测运行框架,能拉起 Claude Code、Codex CLI、OpenHands、Mini-SWE-Agent,以及专门为这篇做的中立脚手架 Terminus 2。Terminus 2 只暴露无头终端,全程 Bash。市面脚手架常按自家模型调过,模型和 agent 缠在一起。Terminus 2 用来把模型差距拆出来。
93 人交了 229 题,三位有经验审稿人按质量筛下 89 题,构成 Terminal-Bench 2.0。平均每题约 3 小时人工审核。硬门槛:oracle 必须全过,空转 dummy 必须全挂,LLM 扫常见坑,对抗 exploit agent 找捷径,合并后再用强模型跑轨迹复查。
软件工程最多(26 题),没有任何一类占多数。有完成时间估计的题里,专家 48.6% 不到 1 小时、47.3% 在 1 小时到 1 天;初级 71.6% 落在 1 小时到 1 天,4.1% 超过一周。最重的 fix-ocaml-gc 是修一次失败的 OCaml GC 优化,专家约 24 小时,初级约 10 天。
6 个 agent、16 个前沿模型,每对至少 5 次,共 32,155 次 trial。推理强度用厂商默认(OpenAI / Anthropic 为 medium)。闭源走官方 API,开源走 Together.AI。Daytona 上 32 到 100 路并行。
每个模型取其表现最好的脚手架,解析率(最终状态通过全部测试的比例)如下。
| 组合 | 解析率 |
| GPT-5.2 + Codex CLI | 63% |
| Claude Opus 4.5 + Terminus 2 | 58% |
| Gemini 3 Pro + Terminus 2 | 57% |
| Kimi K2 Thinking + Terminus 2(开源最高) | 36% |
| 较小模型 | 约 15% |
前 13 名全是闭源。Codex CLI 从 GPT-5-Nano 换到 GPT-5.2,解析率提高 52%;Gemini 2.5 Pro 从 OpenHands 换到 Terminus 2,提高 17%。换模型通常比换脚手架更划算。仍有题任何组合都解不出,系统配置、内核驱动编译、数据库迁移反复出现在全员挂的区域。
单次成本大约 1 美元到上百美元。多数 trial 20 分钟内结束;极端可到 2 小时、上百次 API 调用、单题接近 1 亿 token。回合数和 token 量与成功率几乎没有相关。
想得更久、吐得更多,过不了这套题。
从 Gemini 2.5 Pro 到 GPT-5.2 约八个月,SOTA 几乎翻倍。按这个斜率,2.0 可能一年内被刷满。
人标难度和模型体感正相关(r=0.436,p<0.001),对齐不紧。人标 hard 的题 93.3% 对模型也 hard;人标 medium 里 54.5% 模型觉得 hard。对不上的是 XSS 绕过滤、Core Wars 策略这类对抗题。照文档走的流程型 medium 题,模型更稳。
失败分析固定 Terminus 2,分 Execution(执行)、Coherence(连贯)、Verification(自检)。Opus 4.5 和 GPT-5.2 以执行错误为主;Qwen 3 Coder 480B 三类都更高、更均衡。命令错误率从 Grok 4 的 9.2% 到 GPT-OSS-120B 的 26.7%。3800 条失败命令里,可执行文件未安装或不在 PATH 占 24.1%,运行失败占 9.6%。
做 coding agent 或 CLI 产品的人可以直接拿这套题当难考卷:真实 shell、长程、测试判分、题目来自专家工作流。Harbor 还把 26 个已有 benchmark 适配进同一格式。Terminus 2 能看出掉点在执行、连贯还是自检。
堆回合、堆 token 在这套题上对不上更高分。命令失败最大头是环境里没有那个程序。公开分数按每模型最佳脚手架取点,引用 63% 必须带着 Codex CLI。Gemini 2.5 Pro 换脚手架就能动 17%,接近的排名会被掀翻。
这是更难、更干净的评测基建,不是新的 agent 算法。
允许上网装包和检索,理论上能搜到公开 oracle;数万条轨迹里没见到,用户仍要自己盯。仓库加了 Big-Bench canary 防无意污染。故意拿去训练没有私有测试集可挡。
包版本和镜像钉死了,外网源和宿主机资源仍会让环境漂。众包换多样性,三小时审核拦不住全部漏题。用 Agentic Benchmark Checklist 自检时写明:没有用覆盖率衡量测试质量,硬件和外部调用仍可能 flaky,发布时没有 held-out 集。
解析率是最佳脚手架数字,不是统一 harness 的模型赛。失败标签靠 LLM judge,和人工的一致率在 82% 到 92% 之间。26 个适配题没有在主实验里当对照基线报分。