ClawBench 在 144 个真实网站测 Agent:最强模型成功率仅 33%

jiqizhixin · x · 2026-09-11

MMLU-Pro 作者联合 TIGER Lab(滑铁卢)、UBC NAIL Group、UniPat AI 与 CMU 发布 ClawBench,一个在真实生产网站上测试 AI agent 的新基准。

与现有基准的区别:WebArena 用沙盒里的假静态网站,OSWorld 只覆盖少数 VM 应用,前沿模型能拿 65–75% 的高分显得「接近可用」。ClawBench 则使用 144 个真实生产网站、153 个日常在线任务(订机票、报销、提交求职申请等),无沙盒、无静态页面,agent 要像人一样应对登录认证、动态内容、弹窗和真实 UI 复杂度。

主要结果:

结论:沙盒基准上的高分严重高估了 web agent 在真实网站上的能力,离实际部署仍有很大差距。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →