OSWorld 2.0 揭示:AI Agent 长任务成功率暴跌至 20%
shashib · x · 2026-08-23
- 测试升级:OSWorld 2.0 将任务时长从约 30 步提升至 318 步(需 1.6 小时),更贴近真实工作流。
- 性能跳水:Anthropic 领先模型在旧版得分 80+,在新版仅获 20.6%,证明长任务仍是软肋。
- 快速追赶:两个月后,新模型将分数从 20.6% 提升至约 70%。
- 成本对比:计算机使用 Agent 估算时薪 6-8 美元,外包人工约 10-12 美元。
- 核心结论:高分不代表实战可靠,Benchmark 提升快可能只是针对测试的过拟合。
「编程与Agent」频道最新
- MegaMemory 让编码 Agent 构建项目知识图谱,实现跨会话记忆 — tom_doerr · 2026-08-23
- Claude Code 远程控制升级,支持手机同步操作 — daniel_mac8 · 2026-08-23
- Biscuit 实现 Agent 在浏览器与服务器间无缝接力运行 — Vjeux · 2026-08-23
- 300 个 Agent 产生 4 万种关系,图数据库解决信息噪声 — Roger_M_Taylor · 2026-08-23
- Hermes 支持导出导入 Agent 全配置,解决单机依赖痛点 — Roger_M_Taylor · 2026-08-23
- 发布 MCP Failure Lab:寻找并测试 MCP 客户端与服务的故障路径 — No-Reporter6150 · 2026-08-23