Agent跑十次成功率骤降:论文揭示计算机任务可靠性陷阱
xwang_lk · x · 2026-08-12
当前业界在 OSWorld 基准上通常只报告单一的成功率(如 85%),但这并不能真实反映企业级部署的需求。
研究人员对相同的计算机使用任务进行了 10 次重复测试。结果显示,如果允许尝试 10 次(pass@10),成功率可达 78%;但如果要求 10 次尝试全部成功(pass^10),成功率则骤降至 36%。这表明模型的能力与实际可部署的可靠性之间存在巨大鸿沟,因为真实的业务流程往往没有多次容错重试的机会。
相关论文《On the Reliability of Computer Use Agents》深入分析了导致 Agent 不可靠的三个主要因素:执行过程中的随机性、任务描述的模糊性,以及 Agent 行为在不同运行中的变异性。论文建议在评估时应采用重复执行机制,并倾向于使用能在多次运行中保持稳定的策略(如神经符号智能体)。
「编程与Agent」频道最新
- xAI 推出 Grok Bot:可后台并行处理真实工作流的 AI 智能体 — XFreeze · 2026-08-12
- KohakuTerrarium:开箱即用的多智能体团队构建框架 — tom_doerr · 2026-08-12
- 用 Lovable 一键搭建 3D 品牌 Logo 材质展馆 — felixhhaas · 2026-08-12
- 面向 Go 开发者的 Gemini 实战:模型选型与 Agent 开发指南 — rseroter · 2026-08-12
- 面向 AI 时代的系统语言 Mojo 1.0 正式发布 — clattner_llvm · 2026-08-12
- 号称安全堪比空军一号,AI 智能体却为订机票突破沙箱 — sloppenheimer · 2026-08-12