TUA-Bench: A Benchmark for General-Purpose Terminal-Use Agents
Shoufa Chen, Luyuan Wang, Xuan Yang, Zhiheng Liu, Yuren Cong, Yuanfeng Ji, Feiyan Zhou, Xiaohui Zhang, Fanny Yang, Belinda Zeng
www
cs.SE, cs.AI
2026-06-27
Meta推出通用终端代理基准TUA-Bench,覆盖120项办公、网页与科研工程任务。最强配置Claude Code+Opus 4.8成功率65.8%;同一模型换脚手架,Claude与GPT排名会反转。
通用计算机使用代理已经不只写代码:改表格、管邮件、查网页、跑专业仿真,都开始往终端里塞。评测却还是两套尺子。OSWorld、WebArena 这类盯 GUI,测的是截图、坐标和布局;Terminal-Bench 这类盯 shell,测的是编程、环境配置和系统活。夹在中间的那块,用命令行完成「本来要点鼠标」的日常工作,外加博士级科研工程流程,几乎没有统一、可执行打分的基准。
问题是真的。语言模型的输入输出都是文本,CLI 的命令和反馈也是文本,对齐成本低;GUI 评测会把视觉定位、分辨率和渲染差异算进「会不会用电脑」。GitHub CLI、Slack CLI、gcloud、OpenCLI 又在把应用一个个暴露成命令。没有覆盖日常加专业的终端基准,就分不清一个代理是会敲命令,还是能把电脑当通用工具使。
TUA-Bench 一共 120 道手工题,跑在真实 Linux 终端里,每题带确定性 setup 脚本,按最终环境状态打分。编排层是 Harbor,和 Terminal-Bench 同一套容器基础设施,支持 Docker 和无需 sudo 的 Podman。五大家族:Office & Productivity 占 38.3%,Web & Information 18.3%,System & Software 15.8%,Scientific & Engineering 14.2%,Multimedia & Design 13.3%,下再拆 20 个子类。
日常轨把 OSWorld 的 369 道 GUI 题改写成 CLI。只保留用户意图,不指定必须用哪个软件;输入文件和 gold 产物沿用。人工核掉输入与 gold 对不上的题,例如幻灯片主题不一致,代理按意图做对了仍会被 verifier 判失败。为了不被很快刷满,用 GPT-5.5、Claude Opus 4.7、Gemini 3.1 Pro 在 Terminus-2 上各跑 5 次,留下综合可解性最低的 100 道。OSWorld 发布时最强只有 12.24%,后来 GPT-5.5 报到 78.7%。
专业轨和生物、医学物理、建筑、机械方向的博士一起设计,要求流程真实、步骤够长、输出可验。初始 25 道,去掉已经偏容易的,留下 20 道,软件包括 CellProfiler、3D Slicer、OpenStudio/EnergyPlus、OpenFOAM。两边合计从 394 个候选筛到 120。
每题 5 次独立试验,报平均成功率、Pass@1、Pass@5,以及五次全过的 All-5。默认时限 2400 秒。五个脚手架是 Terminus-2、Codex、OpenHands、Mini-SWE-Agent、Claude Code,模型从 Opus 4.8、GPT-5.5 一路到 Haiku 4.5 和开源权重。
固定 Terminus-2 时,三家前沿挤成一团:GPT-5.5 60.1%±0.6,Claude Opus 4.8 59.7%±1.0,Opus 4.7 58.0%±0.8。头两名差距小于试验波动。稳定性不是一回事:Opus 4.8 的 All-5 是 42.5%,GPT-5.5 只有 31.7%。再往下大约 9 个点掉进中游,Gemini 3.1 Pro 49.3% 到 Qwen3.7-Max 44.9%。同门 Claude 分层清楚:Opus 59.7%,Sonnet 4.6 42.8%,Haiku 4.5 23.9%。
各脚手架配自己最强模型:
| 脚手架 | 模型 | 成功率 | Pass@1 | All-5 |
| Claude Code | Opus 4.8 max | 65.8% | 58.8% | 51.7% |
| Codex | GPT-5.5 xhigh | 64.7% | 57.7% | 42.5% |
| OpenHands | Opus 4.8 max | 63.4% | 57.3% | 45.0% |
| Mini-SWE-Agent | GPT-5.5 xhigh | 62.4% | 54.2% | 40.0% |
| Terminus-2 | GPT-5.5 xhigh | 60.1% | 52.3% | 31.7% |
Codex 的 Pass@5 最高,68.3%,五次里能撞上更多题;Claude Code 更稳,All-5 到 51.7%。
同一对模型换脚手架,名次会翻。Mini-SWE-Agent 上 GPT-5.5 比 Opus 4.8 高 5.0 点(62.4% 对 57.4%);OpenHands 上 Opus 4.8 反超 2.0 点(63.4% 对 61.4%);Terminus-2 上两人几乎持平(60.1% 对 59.7%)。三个开源脚手架一平均,GPT-5.5 61.3%,Opus 4.8 60.2%。单个 harness 上的「谁更强」站不住。
时限从 150 秒拉到 2400 秒,600 次试验里超时从 337 掉到 4,成功率从 33.0% 升到 60.1%。多出来的 27.1 点,很多是没跑完。1200 秒已经 57.1%,再加时间收益变小。思考强度从 none 的 36.5% 升到 xhigh 的 60.1%;high 再加到 xhigh 只多 2.3 点,输出 token 从约 13K 涨到约 19K。39 组配置单次成本大约 12 到 304 美元。便宜端 Terminus-2 + MiniMax-M3 约 47%、12 美元;GLM-5.1 约 48%、23 美元。顶点 Claude Code + Opus 4.8 是 65.8%、173.61 美元,Codex + GPT-5.5 是 64.7%、约 138 美元。过了大约 105 美元,曲线就平了。
类别上 System & SW 大家挤在高位。Office 和 Multimedia 多数掉到 45% 以下,最强也只在 50% 出头。任务级热图里,幻灯片对齐、图片高度、删除线这类题几乎所有配置都红,加思考预算也救不回来。
这是一张比「会不会 git 和写测试」更宽的终端尺子。办公文档、联网检索、专业仿真都在同一套执行打分里。最强 65.8%,Office 还卡在五十出头,前沿还没把电脑当稳的通用工具。
对选型的人,脚手架和模型是同量级变量。只报一个 harness 上的模型排名,会被编排层吃掉。部署上中高思考档更划算,再往上砸 token 只换两三个点。开源权重配 Terminus-2 能在十几美元拿到接近 50%,适合做回归,不适合当能力上限。
这是渐进的评测工作,不是新的代理算法。价值在把「终端通用」落成 120 道可复现的题,并把 harness 敏感度写成表。
论文自己列了:不少应用没有成熟 CLI 或无头接口;专业轨只有四个学科、20 道题;指令全是英文;公开后可能进训练数据;固定版本的无头工具要持续维护容器。
日常 100 道是按三家当时前沿「最难」筛的,后来的模型会吃亏,分数也会系统性偏低。OSWorld 改 CLI 后代理可以换工具完成同一意图,和原 GUI 分数不能横比。专业题在程序验证不够时用专家量规加 LLM-as-a-judge,和纯执行打分混在一起。成本写的是每次 run 的美元,120 题乘 5 次的整套账单没有单列。All-5 和均值的缺口说明种子很敏感,65.8% 是五次平均,不是一次就能稳拿到的数。