OSWorld 2.0评测:电脑操控智能体远未可靠
pstAsiatech · x · 2026-07-06
OSWorld 2.0基准针对长程真实任务评测电脑操控智能体。论文显示当前智能体在电脑使用上仍远不够可靠:最强配置(开启最大思考与批量工具调用的Claude Opus 4.8)二元准确率仅20.6%、部分得分准确率54.8%;任务越长性能下降越明显,在恢复隐藏状态、跟踪大量条目、处理冲突信息或适应变化需求时表现最差。
「编程与Agent」频道最新
- 9B Ollama Agent 可本地跑电台 DJ:工具、记忆和 TTS — pinku1 · 2026-07-27
- Bugbot 拒绝一个会破坏路径隔离的 MCP 权限标志 — zeeg · 2026-07-27
- 一个 GPT-5.6 agent 在看家,另一个在做恶搞说唱 — repligate · 2026-07-27
- Agent 复用已登录浏览器后,风控问题反而解决了 — armanidev_ · 2026-07-27
- 论文提出图拓扑可成为 AI Agent 核心框架 — theomitsa · 2026-07-27
- Claude Code 桌面版新增 UI 标注反馈编辑 — EricBuess · 2026-07-27