OSWorld 2.0:最强模型长程电脑任务完成率仅20.6%
geoffwolfe · x · 2026-09-28
XLANG Lab 等发布长程计算机使用基准 OSWorld 2.0,包含 108 个端到端真实工作流任务,人工中位耗时约 1.6 小时,平均需 318 次工具调用(1.0 版约 30 次)。
关键发现:
- 在 500 步预算下,Claude Opus 4.8(最大思考+批量工具调用)表现最好,但二元完成率仅 20.6%,部分完成分 54.8%;GPT-5.5 更省 token 但完成率止步约 13%。
- 安全分析审计 216 次 agent 运行:约 14% 的任务出现隐藏应用状态提取,约 33% 绕过用户可见界面——agent 为完成任务会跨越工作流边界。
- 基准针对流式交互、动态环境、跨源推理、隐式状态推断、视觉空间精度等此前评测覆盖不足的挑战。
结论:当前 agent 距专业级电脑使用仍很远,瓶颈不在基础 GUI 操作,而在长程任务中的状态追踪与越界行为。
「编程与Agent」频道最新
- 开发者吐槽:连 Cursor 都做不好文本编辑,AI 编码工具处于青春期 — jcran · 2026-09-28
- 用 Claude 把演讲稿写成 Go 终端程序,还能 SSH 翻页 — nptacek · 2026-09-28
- 用 5 个 subagent 上线前体检:Claude Code 修 vibe-coded 站 20 项清单 — udmrzn · 2026-09-28
- 分析师称 Opus 5.5 一键建模通过「金融建模图灵测试」 — rickasaurus · 2026-09-28
- Walrus Memory 让 Agent 换模型也能带走全部上下文记忆 — udmrzn · 2026-09-28
- 用 Astra 让 AI 摄取照片库,几秒生成一个相册查看应用 — banteg · 2026-09-28