惨烈!Claude/GPT 真实网页 Agent 任务失败率超 66%

机器之心 · wechat · 2026-09-02

ClawBench 评测框架在 144 个真实网站上测试了 AI Agent 的日常任务处理能力。结果显示,表现最好的 Claude Sonnet 4.6 完成率仅 33.3%,GPT-5.4 更是低至 6.5%。

核心发现:

亮点模型:Qwen 3.5 以 26.1% 完成率排名第二,且 API 成本最低,展现出良好的执行纪律;GLM-5 虽然速度慢,但成本极低。

结论:现有 Agent 在受控沙箱中表现优异,但在真实互联网环境下的鲁棒性和长期规划能力仍存在巨大鸿沟。

原文链接 →

「应用」频道最新

更多「应用」频道 AI 资讯 →