Terminal Agents: A Survey of AI Agents in Command-Line Environments
Yi Bin, Xiaoyang Yuan, Haoxi Zeng, Wencheng Ye, Wenqi Shao, Chen Qian, Wei Ye, Yujuan Ding, Zheng Wang, Pengpeng Zeng, Jingkuan Song, Heng Tao Shen
cs.AI, cs.SE
2026-08-21
同济大学等把终端Agent立成一类,给出七维能力画像和186篇研究语料。固定条件下SWE-agent比mini最多高出21.25点,Flash与Pro相差不超过2.50点。
LLM agent 越来越多地通过终端改文件、装依赖、跑测试、看日志。现有综述把这些行为拆进软件工程 agent、工具调用和 GUI/浏览器 computer-use,没有把「进度是不是靠命令执行推出来的」当成切面。
结果是 SWE-bench 上的仓库修补、Terminal-Bench 上的命令流,以及 Claude Code、Codex CLI 这类部署形态,被当成不同故事。这篇用终端作为执行基底,给出 workload 级边界,再用七维能力把架构、学习和评测串到同一套语言上。
判定一条 workload 算不算终端 Agent,看三条:
偶发调一下 shell、一次生成补丁再不跑,都不算。SWE-agent、以终端为主的 OpenHands 工作负载在范围内;纯静态补丁生成、GUI agent、只把 CLI 当入口的助手在范围外。
七维能力按控制对象、下一步看什么证据、跑偏了怎么处理来切:命令与动作构造、反馈与产物解读、运行时与环境管理、状态任务与上下文追踪、进度校验、恢复与适应、治理与副作用控制。
架构上拆四层:接口与观测、运行时与工作区、控制/校验/恢复/治理、harness 与上下文。行为由模型、接口、harness、运行时、环境共同决定,不能只报模型名。
语料覆盖 2022 年到 2026 年 8 月,研究条目 186 篇,其中 112 篇来自 2026 年;另引用 Claude Code、Codex CLI、Aider、Gemini CLI 等部署工具作对照。
文献侧有几条已经收敛的观察。可执行轨迹才能把校验和恢复变成监督信号,但现有训练仍集中在成功的仓库轨迹上。评测以最终通过率为锚,过程质量、恢复、治理暴露不均。SWE-EVO 报告从 SWE-Bench Verified 的 65–73% 掉到多文件演化的 21–25%。对五个终端 Agent 基准的审计称 16% 的任务可被 reward hacking。WildClawBench 报告过 18 个百分点的 harness 条件差距。
论文自己做了两组固定条件诊断。第一组锁死 mini-SWE-agent + DeepSeek-V4-Flash,换四个基准家族:
| 基准 | 题数 | 官方得分 | 末窗校验 P5 | 治理触发 P7 |
| Terminal-Bench 2.1 | 241 | 52.6% | 29.5% | 0.5% |
| SetupBench | 93 | 59.1% | 36.6% | 1.4% |
| LongCLI-Bench | 21 | 23.8% | 23.8% | 4.5% |
| BashArena | 640 | 41.8% | 66.2% | 3.0% |
规则匹配的调用失败率 P1 在四个基准上都是 0.0%,这个信号太窄,抓不到语义层的动作错误。末窗校验和治理触发随基准家族差出好几倍。
第二组在相同题号上比三套系统。Claw-SWE-Bench Lite(80 题)上,SWE-agent 的 resolved 是 76.25%(Flash)/77.50%(Pro),mini-SWE-agent 是 58.75%/56.25%,OpenHands 是 68.75%/67.50%,最大系统差 21.25 个百分点。SWE-bench Lite(300 题)上同一套系统最多只差 7.00 点,而且 OpenHands 与 mini 的相对名次对调。同一系统内 Pro 相对 Flash 的差不超过 2.50 点,配对检验不显著。
对做编码 Agent 的人,这篇把一个已经在用的事实写清楚:分数是模型、接口、harness、运行时和预算的耦合产物。他们的诊断里,换系统能拉开 21 点,换 Flash/Pro 拉不开 3 点。只报模型、不报 harness 和运行时条件,跨论文比较基本不可读。
对评测设计,仓库修补不等于终端能力。Setup、长程、安全基准各自照亮不同维度,没有哪一张排行榜能代替过程证据。可回放轨迹、新鲜题、把治理和任务成功放在同一套协议里,是这篇给出的可执行议程。
诊断是每格一次正式 run,没有报多 seed。模型只用 DeepSeek-V4 两个变体,不能外推到其他模型族。P1 全零说明过程指标的操作化仍然粗。LongCLI-Bench 只有 21 题,辅助的反馈/状态/恢复指标只宜方向性解读。语料和经验基础仍偏软件工程,运维、数据、科学工作流、安全的证据是作者自己标成碎片化的。综述不提出新算法,配套 GitHub 仓库是文献索引,不是可复现实验套件。