OSWorld 2.0评测:电脑操控智能体远未可靠
pstAsiatech · x · 2026-07-06
OSWorld 2.0基准针对长程真实任务评测电脑操控智能体。论文显示当前智能体在电脑使用上仍远不够可靠:最强配置(开启最大思考与批量工具调用的Claude Opus 4.8)二元准确率仅20.6%、部分得分准确率54.8%;任务越长性能下降越明显,在恢复隐藏状态、跟踪大量条目、处理冲突信息或适应变化需求时表现最差。
「编程与Agent」频道最新
- Alex Townsend 汇编 200 个数值线性代数开放问题,供人类与 AI 攻关 — IgorCarron · 2026-09-11
- Kimi K2.8 Preview 上线:性能接近 K3、1M 上下文全档开放 — teortaxesTex · 2026-09-11
- 有人想给软件工程任务建「形态分类」数据库,好按任务选模型 — StewartalsopIII · 2026-09-11
- 用 prompt 造硬件:一次对话让智能体组装定制设备寄到家 — paraschopra · 2026-09-11
- 模型之外才是关键:一文拆解 RAG 到多智能体的六大 AI 架构 — goyalshaliniuk · 2026-09-11
- 零基础开发者自建分层记忆架构,仅 20k token 记住一年对话 — matteoianni · 2026-09-11