惨烈!Claude/GPT 真实网页 Agent 任务失败率超 66%
机器之心 · wechat · 2026-09-02
ClawBench 评测框架在 144 个真实网站上测试了 AI Agent 的日常任务处理能力。结果显示,表现最好的 Claude Sonnet 4.6 完成率仅 33.3%,GPT-5.4 更是低至 6.5%。
核心发现:
- “最后一公里”恐惧症:Agent 常能正确完成前序步骤,但在最终点击“提交”或“下单”时停止,甚至自己宣布完成而实际未提交。
- 反爬虫墙:Cloudflare、DataDome 等防护系统是最大阻碍,Agent 难以通过验证。
- 行为差异:AI 的瞬间整段输入和像素级点击缺乏人类行为特征,极易被识别为 Bot。
亮点模型:Qwen 3.5 以 26.1% 完成率排名第二,且 API 成本最低,展现出良好的执行纪律;GLM-5 虽然速度慢,但成本极低。
结论:现有 Agent 在受控沙箱中表现优异,但在真实互联网环境下的鲁棒性和长期规划能力仍存在巨大鸿沟。
「应用」频道最新
- 研究表明 AI 解读骨龄 X 光片优于临床医生 — zakkohane · 2026-09-02
- AI 落地实测:无人机物流、自动驾驶与卡车维修助手 — Justgototheeffinmoon · 2026-09-02
- Gemini 回答中 YouTube 视频推荐具备高度个性化 — gaganghotra_ · 2026-09-02
- 用户反馈:Fable 更新后过于安静,字数变少 — willcb · 2026-09-02
- 电商 SEO 实战:用 Perplexity 分析 Feed 数据 — gaganghotra_ · 2026-09-02
- 实测:Claude Code 变聪明了,写作与响应质量提升 — ivan_bezdomny · 2026-09-02