新综述:定义终端 Agent 的能力与评估
omarsar0 · x · 2026-08-25
这是一篇关于终端 Agent 的综述论文。现有研究将终端行为分散在软件工程、工具使用等领域,本文将 Terminal Agent 定义为通过终端命令执行、文本反馈和有状态环境交互为主导的系统。
- 核心框架:提出了七维终端能力画像,连接系统架构、能力获取和评估。
- 关键发现:实际行为由模型、接口、Harness、运行时和环境共同塑造。可执行轨迹使学习基于行动后果。
- 评估问题:现有评估强调最终结果,对过程质量、恢复和治理的暴露不均。不同基准暴露的过程信号不同,组件归因受限。
论文建议明确报告系统和运行时条件,并支持可重放的轨迹和过程级证据。
「编程与Agent」频道最新
- 仅靠模糊 Prompt 无法从头构建新软件 — zeeg · 2026-08-25
- 用 MCP 接入健康数据:Claude 直接看验血报告 — Reasonable_Scene5364 · 2026-08-25
- 开发者实测 Conductor MCP:管理云端会话 — vinvan · 2026-08-25
- PyTorch 确定性算法 issue:跨设备随机数一致性难题 — rice_fry · 2026-08-25
- Replit 免费模式实战:压力测试、迭代与改进三步法 — amasad · 2026-08-25
- 开发者让 Qwen 27B 自主编写 C 编译器,六周跑出可产 x64 ELF 成品 — Naiw80 · 2026-08-25