Agent Against Agent: An Agentic System for Automatic Prompt Injection Red Teaming
Yanting Wang, Chenlong Yin, Runpeng Geng, Jinyuan Jia
cs.CR
2026-08-06
PIMiner 用分层记忆让搜索式 prompt injection 红队学会积累攻击经验,策略库可直接迁移到新模型,GPT-5.1 上成功率 62%、训练成本约 20 美元。
LLM agent 接了工具、能联网、能自己执行动作,也就给 prompt injection 敞开了门:攻击者把恶意指令藏在网页、检索到的文档或工具返回里,诱导 agent 执行被注入的任务。要给这类系统做安全验收,红队是刚需,既用来量化有多脆,也用来攒训练数据训防御模型。
现有的自动化红队分两路,各有各的短。RL 路线(RL-Hammer、PISmith)拿强化学习训一个攻击者模型,效果好,但训练时要对目标发上万次请求,而且训出来的攻击者换个目标模型就常常失灵,等于每个 frontier 模型都要重训一遍;GPT-Red 靠在大量 defender 上训来补泛化,代价是接近一次完整 RL 后训练的算力。搜索路线(TAP、PAIR)不训模型,逐样本优化注入提示,省事,但每个样本都从零开始,不去沉淀经验,效果明显逊于 RL。
作者的判断很直接:两条路的差距,根源在「能不能把攻击经验攒下来复用」。RL 靠训练隐式地攒,搜索派一点不攒。问题是,能不能做一个会攒经验的搜索式红队。
PIMiner 是个多 agent 系统,核心是分层记忆。它把攻击经验拆成三层,分别管不同时间尺度的知识:
四个组件串起来跑。策略路由器先把每个样本匹配到最相关的 3 个策略文件(只读每个策略的摘要,不是整库塞进上下文);迭代攻击模块在最多 10 轮里反复打磨注入提示,同时吃进三层记忆——长期记忆跨数据集迁移,数据集内记忆做短期适应,样本内记忆用来诊断上一轮为什么失败、针对性改;一轮跑完,经验消化器分析全部轨迹去更新策略库:成功的攻击要么给已有策略补示例、要么拓宽适用范围、要么新建一个策略文件,失败的攻击则做 miss-pattern 分析,给相关策略缩范围、补失败条件。哪怕一轮一个没打中,库也在变好。
训练是在 8 个「数据集+模型」组合上跑的,把库养熟;测试时这个库直接套到没见过的新模型上,不再训练,每个样本对目标发大约 10 次请求。最终养出的库有 7 种策略、10 个文件,其中 Fabricated Procedure Gate(50 个示例)和 Forged Chat Turn(29 个)占了约八成。
威胁模型这里也得说清:训练阶段是灰盒,攻击者能看到目标每一步的输出(理由是 Claude Code、Codex CLI、Gemini CLI 这些 agent 多已开源,有的还会把工具调用暴露给用户);测试阶段是黑盒,只要最终输出加一个「注入任务成没成功」的 ground-truth 判断。
在 9 个 frontier 模型上做红队,IPIArena 和 AgentDojo 两个 benchmark。三个主力模型的数字(均为 ASR@10):
| 目标模型 | IPIArena | AgentDojo |
| Gemini-2.5-Pro | 76.2% | 86.7% |
| GPT-5.1 | 61.9% | 53.3% |
| Claude-Sonnet-4.5 | 42.9% | 40.0% |
最脆的两个,GPT-4o-mini 在 IPIArena 上被攻破 81.0%,DeepSeek-V4-Pro 在 AgentDojo 上高达 93.3%。Claude-Opus-4.5 是唯一稳住的,IPIArena 上 ASR@10 只有约 4.8%。作为参照,IPIArena 自己报的人工红队 ASR@1 平均只有 1.0%,而 PIMiner 对 Claude-Sonnet-4.5 的 ASR@1 就有 28.6%。
和其它红队方法比,InjecAgent 上 PIMiner 三个目标全打满 1.0,追平 RL-Hammer 和 PISmith,而 PAIR、TAP 在 GPT-5-nano 上分别只有 0.01、0.08。AgentDojo 上和 PISmith 互有胜负:GPT-5-nano 上 PIMiner 0.53 反超 PISmith 的 0.38,GPT-4o-mini 0.73 对 0.78 接近,GPT-4.1-nano 0.63 落后于 0.81。但 PISmith 每个目标模型都要单独训一个攻击者,PIMiner 的策略库是直接迁移过去的,这才是它真正的卖点。
消融印证了分层记忆的价值。去掉策略库或数据集内记忆,效果都掉;完整版比只留样本内记忆的 PAIR 式攻击者,平均 ASR 在 Haiku-4.5 上高 19.8 个百分点、Sonnet-4.6 上高 17.8 个。路由器把攻击者的输入缩短了 43% 到 61%,效果几乎不掉(Haiku −1.2%,Sonnet 反升 7.5%)。另有一组结果值得看:把训好的策略库直接塞进 PAIR、换成非 Claude 家的攻击者(Gemini、GPT、DeepSeek),效果也大涨,比如 Gemini-2.5-Flash 当攻击者,ASR 从 0.14 涨到 0.52。这套库攒的是可迁移的攻击知识,不是绑死在某个攻击者模型上的。
成本上,假设你用自己的 Claude Code 订阅跑攻击者、路由器和消化器,训练阶段额外的钱只花在查目标模型上,约 20 美元(光攻击者模型若按 API 计费约 115 美元);RL 路线训一次要对目标发上万次请求,光 GPT-5 这一项就可能超过 100 美元。
对做 agent 安全的人,PIMiner 把「攒经验」这件事从 RL 训练里拎了出来,变成可读、可迁移的策略库。一个库训完,新模型来了直接套,不用重训。这对要给 GPT-5、Claude 这类贵模型做红队的团队是实打实省钱省事,产出的还是人类可读的攻击策略和训练样本,直接喂防御侧。
那些 ASR 数字本身也值得正视。AgentDojo 上,Gemini-2.5-Pro 被攻破 86.7%、GPT-5.1 一半多、连 Claude-Sonnet-4.5 也有 40%。这是在受控 benchmark、允许 10 次尝试的设定下,但已经说明:今天最强的 agent 模型对 prompt injection 依然相当脆。
作者自己说,这套工作主要跑在 Claude Code 模型上(为了省推理成本),换攻击者模型的迁移性只在那组把库塞进 PAIR 的实验里间接验证,没在全文系统比较不同攻击者主干的训练效果。如果不用 Claude Code 订阅,成本会被攻击者模型的调用费主导,因为策略探索依赖 Opus-4.7 这种又强又贵的模型。
读下来还有几处存疑。第一,测试阶段的黑盒假设里包含一个 ground-truth 成功判断,你得知道注入任务到底成没成,真实部署里不总是给得出。第二,和 PISmith 的比较不算干净赢:AgentDojo 上 PIMiner 在 3 个模型里输了 2 个,「不用逐目标重训」是合理辩护,但不是模型间效果对决的胜利,InjecAgent 上的 1.0 平局更像那个 benchmark 已经接近饱和。第三,评测样本量小(每个模型 21 到 30 条),ASR 一个百分点就是一两个样本的差别,精度有限。第四,所有实验都在公开 benchmark 的沙盒里,真实部署里加了输入过滤、权限隔离等防御的 agent 没测。