OpenART: Scaling Agent Red Teaming via Open-Ended Environment Evolution
Yunhao Chen, Xin Wang, Yixu Wang, Yi Liu, Jie Li, Yan Teng, Xingjun Ma, Xia Hu, Yu-Gang Jiang
cs.CL
2026-08-01
OpenART 把红队的攻击对象从提示词换成 agent 的共享环境状态,跨 75 套配置的攻击成功率达 85.0%,复杂任务上比只改指令高 17 个百分点。
大多数 agent 安全评测还在用「短任务 + 单一接口」的老套路:抛一个工具调用,看模型拒不拒绝恶意指令。ToolEmu 这类基准平均只要 1 到 4 次工具调用。但真实 agent 跑的是长流程,它反复读写一份共享环境状态(工作区、记忆、计划),早先埋下的状态改动会顺着几十次调用一路传导,在很久之后才暴露成不安全行为。这些基准还各用各的接口,没法直接比 Claude Code 和 Codex 谁更安全。OpenART(复旦 + 上海 AI 实验室 + XSafeAI)要补的就是这块:把红队的攻击对象从提示词换成 agent 的可执行环境,并搭一个能跨 15 个真实 agent、5 个基座模型统一评测的场地。
OpenART 分三步。先造场景:从 50 万个以上的工具、MCP、技能里合成出 1 万多个有状态场景,覆盖 50 个领域,每个场景包含一个良性任务目标、一个可执行环境、一份隐藏的安全契约,中位数要 97 次工具调用才能跑完(依赖深度 32)。再把场景做跨 agent 投射:场景本身与目标解耦,运行时由适配器把它接进每个 agent 的原生接口,于是同一套场景能跨 15 个 agent(OpenCode、Aider、Claude Code、Codex 一直到 Qwen Code)乘 5 个模型(GPT-5.5、Opus-4.8、GLM-5.2、Qwen-3.7-Max、DeepSeek-V4-Pro)共 75 套配置跑。攻击面有 8 类:工作区、指令、技能、工具、MCP、短期记忆、计划状态、长期记忆。
关键设计是环境演化:任务目标和安全契约始终不变,只有目标可见的环境状态在变。攻击者 EMHA 是个黑盒策略,不更新任何模型参数,攻击方和被攻方都冻结。它把协同的环境改动建模成一张超图:顶点是攻击子目标,超边把前置条件和后继连起来;用评估器反馈沿路径重分配、做 soft Q-learning 更新路径价值;再维护一个保留最高适应度攻击的存档,用进化算子产生后代。这套思路之所以有效,是因为注入的状态改动平均在第 23% 的执行进度就被消费,但不安全输出要到 64% 才冒头,中位数要传导 37 步。只改提示词够不到这段潜伏风险。
跨全部 75 套配置,pooled Strict ASR(攻击成功率)到 85.0%。按基座模型看差异很大:Qwen-3.7-Max 和 DeepSeek-V4-Pro 最易攻(94.6%、94.7%),GPT-5.5 和 GLM-5.2 居中(88.5%、87.9%),Opus-4.8 最扛打(59.2%)。
| 基座模型 | 攻击成功率 |
| Qwen-3.7-Max | 94.6% |
| DeepSeek-V4-Pro | 94.7% |
| GPT-5.5 | 88.5% |
| GLM-5.2 | 87.9% |
| Claude-Opus-4.8 | 59.2% |
| 全配置均值 | 85.0% |
环境演化相对只改指令的优势随任务复杂度放大:最简单的场景只高 1.8 到 2.7 个百分点,最复杂的场景高 17.2 到 17.6 个百分点。在 DeepSeek-V4-Pro 上跑 5 轮演化,成功率从首轮 42.9% 一路爬到 94.7%,累计涨 51.8 个百分点。方差分解显示,基座模型加能力解释了 73.6% 的成功率差异,而 agent 运行时身份(同样是某个模型,套的是 Claude Code 还是 Aider)额外解释 7.6%。
两条对从业者直接的结论。第一,部署 agent 时风险面不止提示词注入,还有工作区、记忆、计划里累积起来的状态。一个只测模型会不会拒绝坏指令的安全评估,漏掉的就是这种长程漂移。第二,包在模型外面的运行时框架会改变它的安全画像,不只是能力画像。「我们用的是 Opus 所以安全」这种推理站不住,框架本身要背约 7.6% 的锅。85% 这个数更像一根测量标尺:在一个能改动环境、会自适应的强对手面前,当下的 agent 栈大多数时候会失守,Opus 的 59% 是那个值得深挖的异类。
作者承认,虽然数据显示 agent 实现显著影响安全,但没给出机制解释,比如同一个模型下 Claude Code 和 Aider 为什么安全表现不同。场景准入要过一个确定性评估器加 GLM-5.2 判定器,可能引入选择偏差。论文也没讨论环境演化跟不同对齐、安全训练方法怎么交互。成功率高度依赖攻击预算和演化轮次,要跑满 5 轮才从 43% 爬到 95%,防守方可以辩称更低预算下局面不同,不过这条单调上升的曲线本身就是警告。另外安全契约是框架自己定的,它跟你真实部署的策略对不对得上,论文没碰。