TerminalWorld:顶级AI Agent在真实终端任务中通过率仅62.5%
jiqizhixin · x · 2026-07-03
UCL、南京大学与腾讯联合推出 TerminalWorld,通过逆向真实终端录像构建了覆盖 18 类工作流的 1530 个任务 benchmark。当前最优 agent 通过率仅 62.5%,且分数与现有 benchmark 相关性极低,暴露了 AI agent 在真实终端环境中的能力瓶颈。论文已发布于 arXiv,代码与项目主页同步开放。
「编程与Agent」频道最新
- Bugbot 拒绝一个会破坏路径隔离的 MCP 权限标志 — zeeg · 2026-07-27
- 一个 GPT-5.6 agent 在看家,另一个在做恶搞说唱 — repligate · 2026-07-27
- Agent 复用已登录浏览器后,风控问题反而解决了 — armanidev_ · 2026-07-27
- 论文提出图拓扑可成为 AI Agent 核心框架 — theomitsa · 2026-07-27
- Claude Code 桌面版新增 UI 标注反馈编辑 — EricBuess · 2026-07-27
- Anthropic 称 Claude Code 删掉 80% 系统提示词仍不掉分 — krishnan · 2026-07-27