十五组部署各自搜护栏,平均攻击成功率从45.6%降到10%

EvoSafeHarness: Evolving Model- and Domain-Specific Harnesses for Securing Agents

Nanxi Li, Yingzi Ma, Yulong Cao, Edward Suh, Bo Li, Dawn Song, Chaowei Xiao

cs.CR

2026-09-05

为冻结模型按领域联合搜索自然语言策略与可执行代码护栏。DTAP平均ASR从45.6%降到10.0%、效用只掉3.3分,AgentDojo达82.8%效用且ASR为0。

这篇在解决什么

Agent 一旦接上工具,失败就不只是一句难听的回复。转一笔钱、泄一份密钥、删掉生产数据,都可能发生。有害指令走两条路进来:间接注入藏在邮件、网页、工具返回里;直接攻击则来自用户通道本身。

模型侧对齐能提高拒答概率,挡不住模型自己的行为。系统级 harness(护栏)夹在模型与工具之间,改提示、拦调用、管轨迹。现有方案,CaMeL、DRIFT、Progent、SafeHarness,多半由专家一次性设计,再套到各种模型和领域上。有效防护跟着部署走。Sonnet 4.6 无防御 ASR 只有 4.8%,同一套严格能力隔离会把良性效用打残;DeepSeek-V4-Flash 无防御 ASR 高达 71.0%,轻量策略又不够。文件系统要管命令效果、敏感路径和数据流向;金融要区分交易与资金外流,还要记流水,因为单笔都合法的操作拼起来可以是对倒。一套固定护栏很难同时贴合这两类差异。

方法

EvoSafeHarness 给冻结模型 M 在目标领域 D 里搜一套可部署护栏 H=(P,C)。P 是自然语言策略,写进上下文的信任边界和拒答口径;C 是可执行代码,能改写或拦截工具调用、维护轨迹状态、调用隔离分类器。标量目标是 score = 100×(效用 − ASR):全拒和全放都得零分,搜索不能靠什么都不干来刷安全。

闭环有四块。

起步会从 CaMeL、DRIFT 这类成熟防御里蒸馏八条安全经验,当作热身而不是模板。Designer 可以删、重组、发明新机制。DTAP 上最小适配器是带 systemprompttransform、onpretoolcall、onposttoolcall 的 Python 对象,外加任意辅助代码和每条轨迹的状态。搜索只看训练分割,held-out 永不回流。

结果

主场是 DecodingTrust-Agent 的 5 模型 × 3 领域网格,每格 30 条良性、35 条直接、35 条间接。

方法平均效用平均 ASR
无防御83.1%45.6%
CaMeL69.7%37.7%
DRIFT77.1%42.4%
Progent56.4%10.5%
EvoSafeHarness79.8%10.0%

15 格里 14 格拿最高分。直接 ASR 从 50.9% 降到 12.6%,间接从 40.4% 降到 7.4%。唯一输掉的格子是已经几乎打不进的 Sonnet 4.6/finance。Progent 安全数字接近,效用少了二十多个点。McNemar 检验在 13/15 格拒绝「没变化」,全网格 385 次攻击被挡住、新放开 11 次。

AgentDojo 上平均 82.8% 效用、0.0% ASR,同一零 ASR 工作点上 CaMeL 只有 41.0% 效用。这套护栏原封不动迁到没见过工具的 AgentDyn,仍是 75.0% 效用、0.0% ASR,高于无防御的 73.3%/12.8%。它迁得动,是因为卡住的是来源和任务范围,不是工具名单。Agent-SafetyBench 覆盖不安全用户请求和最终回答里的虚假信息,平均清洁不安全行为率 12.3%、ASR 7.4%、受攻击效用 63.4%,固定基线要么漏伤害要么过挡。冻结护栏面对 PAIR 自适应攻击,精炼预算 16 时平均 ASR 19.5%,仍低于无防御面对静态提示的 23.6%。

去掉 Criticizer,搜索集分数不降甚至升高,held-out 分数最多掉 31 点。嵌套级联在 22 个候选库上选出同一套防御,评测 token 省 43.6%。

为什么重要

给要上线 Agent 的人一个明确判断:别抄一套通用护栏。领域决定要保护哪些安全关系、记什么状态;模型和运行时决定这些关系该语义判还是确定性闸、缓不缓存、卡在执行前还是执行后。弱模型不是简单「规则更多」。GLM-5 会重试等价调用,DeepSeek 被拒后会换混淆写法,Kimi 会并发洪水。搜出来的护栏经常把搜索时的语义推理编译成运行时的确定性结构:十五套 DTAP 产物里六套没有自然语言策略 P,四套运行时不再调辅助 LLM。

这是渐进改进里比较硬的一种,把护栏工程从选产品变成按部署生成并验证。搜索本身不便宜,内层评测光目标模型就记了约 5.9 万次调用。适合高风险、工具面相对稳定、愿意付一次搜索成本的场景,不适合每周换栈的玩具 Agent。

局限与存疑

残差并不均匀。105 次漏网里文件系统占 57,金融 41,电信只有 7。未授权访问、最小权限、同意违规、无人值守自动化、针对客户的诈骗五类就占了 54 次。针对客户的诈骗仍是 60.0%(9/15),期权招揽 30.0%,电信金融欺诈 16.7%,几乎没有下降:操作可以完全在授权范围内,伤害藏在捏造陈述或不当建议里,没有可编译的目的地、数量或轨迹不变量。现有适配器只有系统提示、工具前、工具后三个钩子,工具无关的最终回答代码层看不见。

搜索对测试集质量敏感。68 次父子变异里 38.2% 没抬小样本搜索分,15 套返回产物里 7 套不是小样本最高分。外层搜索模型会改变松紧:Kimi-K2.5 上四个搜索器效用都在 83–87%,ASR 却从 5.24% 散到 17.62%。DTAP 十四个领域只评了三个。自适应攻击仍能把 ASR 从 9.7% 抬到最高 25.0%。论文没有把搜索成本摊到每次线上调用上,也没有在真实生产流量里验证。

术语

原文与代码

相关论文

全部论文解读