ClawBench 在 144 个真实网站测 Agent:最强模型成功率仅 33%
jiqizhixin · x · 2026-09-11
MMLU-Pro 作者联合 TIGER Lab(滑铁卢)、UBC NAIL Group、UniPat AI 与 CMU 发布 ClawBench,一个在真实生产网站上测试 AI agent 的新基准。
与现有基准的区别:WebArena 用沙盒里的假静态网站,OSWorld 只覆盖少数 VM 应用,前沿模型能拿 65–75% 的高分显得「接近可用」。ClawBench 则使用 144 个真实生产网站、153 个日常在线任务(订机票、报销、提交求职申请等),无沙盒、无静态页面,agent 要像人一样应对登录认证、动态内容、弹窗和真实 UI 复杂度。
主要结果:
- 最强的 Claude Sonnet 4.6 成功率仅 33%,相当于每三个任务失败两个
- GPT-5.4 只完成 153 个任务中的 10 个(6.5%)
- 44.4%(68/153)的任务没有任何模型能解决
结论:沙盒基准上的高分严重高估了 web agent 在真实网站上的能力,离实际部署仍有很大差距。
「编程与Agent」频道最新
- Greg Isenberg:GPT-6 Astra 将引爆小硬件与实体产品创业 — Rasmic · 2026-09-11
- 开发者压测 atelier 套娃嵌套运行,宣称性能尚可 — lucasmeijer · 2026-09-11
- Redis 之父 antirez 亲手为 ds4 编辑器适配 DeepSeek V4.1 — backyard_tractorbeam · 2026-09-11
- 开发者评 Agents API:难点不是模型,而是让 AI 连续工作数小时 — shaunralston · 2026-09-11
- 用 MacBook 翻盖角度传感器做折叠着色器,作者开源应用 — jh3yy · 2026-09-11
- 开发者:语音写码是继 Vim 指法后最大的效率跃升 — jaivinwylde · 2026-09-11