198篇防护论文编码后,只有1条能证明残余危害为零

The Safeguard Worked. Is the LLM System Safer?

Pingyu Wu, Weiming Zhang, Nenghai Yu

cs.CR, cs.AI

2026-09-01

把拒答率、攻击成功率改写成部署后还剩多少有害帮助。198篇论文里108/152条能证明残余大于0,能证为零的只有1条。

这篇在解决什么

部署侧问的是:加上这套防护之后,服务还肯给攻击者多少有害帮助。论文里报的是另一类数字:拒答率、攻击成功率、策略违规率。这些数字描述控件在被测请求上的表现。Nasr 等人用自适应、知悉防御的攻击打了 12 个 jailbreak 和注入防御,成功率超过 90%,原论文多数报的是接近 0。Jain 等人固定场景后,第一轮攻击成功率 0 到 1%,15 轮适应防御反馈后升到 5.4% 到 14.0%。FragFuse 把违禁请求拆进 agent 记忆,访问控制绕过 86.3%,端到端有害任务成功率只有 41.1%。绕过率不能当完成危害的比率来读。

再多测同类数字,推不出「这个结果到底能支撑什么部署结论」。这篇给出换算表:给定论文报的量,在它自己声明的结果尺度和攻击者类上,对残余有害帮助 Z(S[D]) 能推出多紧的界。

方法

先把部署评估钉成 evaluation anchor:服务 S、防护 D、攻击者策略类 Σ、有害帮助函数 Z、效用下限 q。部署要的量是残余 Z(S[D])。防护效果 VZ(D)=Z(S)-Z(S[D]) 只说明拿走了多少,单独报它推不出还剩多少。

证据要求不对称。下界:Σ 里跑通一次攻击,其有害值就是残余的下界。上界必须罩住整个攻击者类。防护检查走中介时,上界写成 1-α(1-ε)(1-r)。α 是通向目标结果的路径有多少必须进入检查域,叫覆盖;ε 是进入之后的条件失败率;r 是检查成功后还剩多少有害续值,包括已放出的内容、仍允许的动作、累积状态和重试。

三扇门全过才能证零残余:α=1、ε=0、r=0。ε=0 而 α=0 或 r=1 时,上界仍是 1。局部完美推不出全局安全。枚举更多攻击给不出上界,那只是内部样本。多层堆栈如果只有边际失败率,最好上界等于最强单层;只有历史一致的条件界才允许把各层相乘。

这张表被做成 10 槽编码工具。198 篇论文两档编码:24 条声明走完整十槽,152 条走端点路由。编码由两条独立模型通道完成,没有自己跑攻击。

结果

宽编码 152 条里,108 条能证明残余大于 0,全部走攻击见证这一行;零残余证书 0 条,44 条未决。声明是否成立和残余是否有界是两件事。深度子集里,成立的声明可以同时带着正残余。

深度 24 条里,成功事件、条件失败、覆盖分别有 96%、88%、79% 被填上,检查成功后还剩什么只在 5 条里被支持或推导。这 5 条里只有 1 条在同一锚下凑齐三扇门:Fides。它对后果性工具动作做策略检查,架构上 α=1,非干扰给出 ε=0,受检轨迹上不可信数据影响不了后果动作所以 r=0,于是上界 U=0。同一实例里任务完成损失最高 24.5%。同机制家族的 CaMeL 没给出类一致的失败和续值关系,证书开着。f-secure LLM 用证明关上了覆盖和失败两扇门,续值没赋值,上界仍是 1。

RESTA 被判声明成立,多语言 CATQA 上仍有 37.78% 有害回答,下界至少 0.3778。Emulated Disalignment 在四个模型家族上执行攻击得到 32.0%、37.0%、27.0%、57.6%,各是直接下界。7 个能力删除实例没有一个在匹配效用下证明前沿下移。没有一条深度实例给通用串行堆栈报历史一致的条件界。

152 条里 81 条是服务完整性结果,52 条是外界危害,19 条混合。那张零残余证书钉在完整性上。外界危害若满足对偶用途下限 ρ>0,零残余证书本来就不可得。

为什么重要

做防护的人如果只把拒答率从 2% 打到 0.5%,这个数字本身推不动「部署更安全」。缺的是覆盖和续值,不是把 ε 再测精一位。检测准确率是分类器问题,覆盖是架构路由问题,把 r 打到 0 是结构问题,准确率给不了。

对审稿和部署方,可操作的清单是:先钉锚,再选表上那一行,把那一行要的量全部报出来。缺一项,把现有数字做得更好也收不紧界。增益必须按部署系统有没有更安全来判,不能按局部分数来判。

局限与存疑

编码集是饱和样本,不是普查。宽编码裁决是单通道判断,没有做聚合。深度只有 24 条声明,「只有 1 条零残余」对全文献的外推要谨慎。编码由模型通道完成,人只写了协议,槽位填错会直接改结论。Fides 的零残余钉在服务完整性结果上,不能当成对外界危害的通用证书。这篇不跑新攻击,也不给具体产品背书。它证明的是「已发表数字能推出什么」,不是「哪家防护最好」。

术语

原文与代码

相关论文

全部论文解读