跨用户 agent 协作有多险:治理攻击 42.6% 得手,任务做完照样泄密

WeClawArena: An Auditable Sandbox and Benchmark for Cross-User Agents Collaboration and Security in Human-Centered Agent Networks

Prince Zizhuang Wang, Aojie Yuan, Haiyue Zhang, Xiyang Hu, Yue Zhao, Shuli Jiang

cs.AI

2026-08-04

WeClawArena 是首个测跨用户 agent 协作与安全的可审计基准,620 个场景里治理类攻击 42.6% 得手,且有 117 次任务做成的同时攻击也成功了。

这篇在解决什么

现在的 agent 基准基本假设单用户、单工作区:一个 agent 在自己的工具和文件上干活,或多个 agent 在同一片共享环境里协作。但 OpenClaw 这类持久化个人 agent 框架正让人本 agent 网络变成现实部署目标,每个用户配一个 agent,替自己办事、维护状态、通过社交和任务关系跟别人的 agent 通信。在这种网络里,日常工具使用变成跨所有者的多方协作,文件、记录、工具、策略在 owner 之间彼此不可见。现有基准既没有能验证这种跨用户协作的端到端沙箱,也不测有害行为怎么顺着人本 agent 网络传播。WeClawArena 补的就是这个洞,而且把协作效用和安全、隐私、治理危害放在一起评。

方法

每个用户被建模成一个 owner,带着一个 Docker 支撑的私有工作区:文件系统、数据库、工具、策略、委派的 agent。agent 只在自己工作区的权限和可见性约束下行动,私有工作区既是操作工具也是个人约束。一个 gateway 接口路由多 agent 通信、工具调用和工作区访问,并被动记录对端消息、工具调用、资源操作、策略裁决、最终工作区状态,不改 agent 轨迹,事后从这些有界证据包里审计。

覆盖六个跨用户任务域:议价(bargaining)、竞价(bidding)、差旅(travel)、SWE-Workspace(四 owner 的工程流程)、临床(clinical)、交易(trading)。124 个基础任务,每个扩成 5 个场景变体(1 个良性对照加 4 类攻击向量):

评估把效用和攻击分开报:任务成功率 TSR 从最终多工作区状态加证据轨迹确定性地算;攻击成功率 ASR 由 LLM(主图用 GPT-5.2)从有界证据包判定,judge 不能改确定性任务分,只决定这次攻击有没有带着清晰证据链造成最终危害。所有模型跑同一套 Docker 化 OpenClaw 运行时。

结果

八个模型参评:Claude Opus 4.7、Sonnet 4.5、Opus 4.1,DeepSeek V3.2,Kimi K2.5、K2 Thinking,Qwen3 235B、32B。

任务成功率按域分,Opus 4.7 在差旅(83.0%)、SWE-Workspace(34.0%)、竞价(55.0%)领先,Sonnet 4.5 在议价(68.3%)领先、临床并列第一。Qwen3 32B 在多数域只有个位数,SWE-Workspace 仅 1.6%。把效用和攻击合起来看:

模型良性 TSR被攻击 TSRASR(GPT-5.2 判)
Claude Opus 4.776/124(61.3%)231/496(46.6%)13/440(3.0%)
Claude Sonnet 4.560/124(48.4%)165/496(33.3%)76/293(25.9%)
DeepSeek V3.243/124(34.7%)75/496(15.1%)225/435(51.7%)
Qwen3 235B36/124(29.0%)74/296(25.0%)218/392(55.6%)

Opus 4.7 是唯一既最能干又最能扛的模型,开源模型在抵抗力上整体偏低。按攻击面看,治理是最大的洞:治理 400/939(42.6%)、安全 331/922(35.9%)、隐私 251/943(26.6%)、协作 170/939(18.1%),行级 ASR 总体 1,152/3,743,合 30.8%。

最值得警惕的是效用和攻击的联合结果。3,743 行被判定记录里,117 行任务做成了且攻击也成功了,干着活就把危害造出来了;1,035 行任务失败但攻击成功;640 行做成且挡住攻击;1,951 行两者皆败。这 117 行最有诊断价值,它说明一个 agent 完全可以「把活干漂亮」的同时泄露隐私或拿着无效授权行事,光看任务成功率根本看不出来。

为什么重要

人本 agent 网络已经不是纸面设想,OpenClaw 这类框架已经在让 agent 替用户维持状态、跨 owner 通信。一旦 agent 开始跨所有权边界协作,「能不能把事办成」和「办的过程中有没有泄密、有没有被投毒、有没有越权」就必须分开测,因为它们会脱钩,117 行就是证据。WeClawArena 给了一个能在统一运行时里同时评这两面、还能从有界证据审计谁动了什么、哪条消息、工具或授权路径出了问题的沙箱。对做 agent 安全的人,治理类攻击 42.6% 的得手率是个明确信号:跨 owner 的授权和同意校验是当前最脆的一面,比单纯的工具误用或信息泄露都好打。

局限与存疑

作者把方法论边界说得很清楚。只有「可评分的运行」计入分母,格式错的场景、证据缺失、评测器崩溃、不可裁决的终态都被排除,所以 ASR 是在有据可判的子集上算的。证据路径是硬约束:一旦某条被记的消息、工具调用、资源操作、治理动作或最终产物能绕过 gateway 和记录下来的工作区状态,这次运行就撑不起可靠的攻击成败判断。ASR 用 LLM 当 judge,依赖有界证据包的质量,作者用 Opus 4.7 做了敏感性复核,并坦承没有哪个模型在每个危害面上都占优。六个域、124 个基础任务对一个全新问题设定来说只是起步覆盖,各域难度差异也很大,差旅和议价跟 SWE-Workspace 完全不在一个量级。作者也没有做 sim-to-real 的迁移声明。

术语

原文与代码

相关论文

全部论文解读