Agent跑十次成功率骤降:论文揭示计算机任务可靠性陷阱

xwang_lk · x · 2026-08-12

当前业界在 OSWorld 基准上通常只报告单一的成功率(如 85%),但这并不能真实反映企业级部署的需求。

研究人员对相同的计算机使用任务进行了 10 次重复测试。结果显示,如果允许尝试 10 次(pass@10),成功率可达 78%;但如果要求 10 次尝试全部成功(pass^10),成功率则骤降至 36%。这表明模型的能力与实际可部署的可靠性之间存在巨大鸿沟,因为真实的业务流程往往没有多次容错重试的机会。

相关论文《On the Reliability of Computer Use Agents》深入分析了导致 Agent 不可靠的三个主要因素:执行过程中的随机性、任务描述的模糊性,以及 Agent 行为在不同运行中的变异性。论文建议在评估时应采用重复执行机制,并倾向于使用能在多次运行中保持稳定的策略(如神经符号智能体)。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →