中科大证明 LLM 安全不可能三角:有用、安全、开放访问只能三选二

Safeguards Based on Copyable Context Cannot Provide Reliable Safety for LLMs

Pingyu Wu, Lingyao Zhu, Weiming Zhang, Nenghai Yu

cs.CR, cs.AI

2026-07-30

形式化证明:护栏若靠攻击者能复制的上下文来判断,保留合法效用的同时就必然给攻击者留下底线帮助,出路只有可信凭证。

这篇在解决什么

LLM 的安全护栏(safety training、输入输出过滤、意图检查、交互式追问)都共享一个时间点上的结构缺陷:它们在看到答案被怎么用之前,就要决定放不放行。

双用途(dual-use)任务把这个缺陷变成硬伤。同一段漏洞分析,交给授权的安全评估团队是合规的,交给入侵者就是犯罪,而两者要的技术内容字节相同。攻击者只要照着合法用户的样子提交请求、声称相同的目的、把交互历史复刻一遍,护栏在放行那一刻手里就没有任何能把两者区分开的信息。

这不是分类器精度的问题。放行那一刻,能区分两者的信息根本不在场。近两年反复出现的越狱、自适应攻击、多轮拆解,根子都压在这一点上。这篇论文把这条直觉写成定理:在证据可复制的条件下,护栏给攻击者的最坏情况帮助有一个精确的、绕不开的下限,叫能力底线 Γ(q)。

方法

作者把两件事拆开看:释放的能力(答案本身能给多大利害价值)和关于下游用途的证据(请求、声称的意图、对话历史这些放行前可观测的东西)。

先在「两个用途拿到相同输出分布」的基准上算底线。对一个固定任务,释放菜单里每个动作 a 有两个效用:合法用途 uB(a) 和最坏恶意用途 uM(a)。能力底线 Γ(q) 是在「合法效用不低于 q」的所有释放分布里,攻击者帮助的最小值,它是个凸的分段线性函数。

双用途条件要求:凡是对合法用途有价值的释放,都至少有一种恶意用途。在这条前提下 Γ(q) ≥ ρq > 0,只要想给合法用户正的效用,就一定同时给攻击者留下一份正的帮助。

接着是可复制证据(copyable evidence)。如果攻击者能把合法用户的应答策略在每个可达历史上完整复刻(命题 1),那么两者的对话法则是字节相同的,护栏做多少轮追问、用什么公开随机化,都看不出差别。

定理 1 把这件事钉死:证据可复制时,任意交互式护栏,无论它问几个问题、怎么变着花样决定、跨多次尝试怎么拼证据,最坏情况都精确退化成一个静态的释放菜单,等于 Γ(q)。把复制做得不完美,只软化这个底线一个 TV 距离 δκ(公式 12)。

推论 1 给出整个论文最抓人的结论:安全不可能三角。在双用途任务里,「有用(合法效用 ≥ q)」「可靠安全(攻击帮助 ≤ β < Γ(q))」「开放访问(不用可信凭证、只用可复制证据)」三者不能同时成立,只能三选二。

能把 Γ(q) 压下去的只有可信凭证(trusted credential):一种攻击者无法自由获取或复制、且其取值能预测真实下游用途的信号,比如已验证的角色、平台远程证明、持久历史。它的预测力用 d = TV(PB^S, PM^S) 度量,对应的均衡二分类精度是 (1+d)/2。定理 2 说,引入这个信号后,对话历史在 worst case 下不再带来信号之外的任何信息。推论 3 给出零帮助的充要条件:合法效用必须落在攻击者拿不到的信号取值上。定理 3 给出必要条件 β + d + ηκ ≥ Γ(q),安全上界、凭证质量、复制误差三者之和必须够大。

最后,命题 2 把底线跨多个相关会话精确相加,意味着把任务拆成多段、重试多次,都不能降低底线。

结果

这是一篇定理论文,「结果」是不等式和等价关系,不是 benchmark 数字。

目标组合谁能满足
有用 + 开放访问静态释放菜单的最优分配
可靠安全 + 开放访问恒定拒绝
有用 + 可靠安全引入可信凭证(放弃开放访问)

必要条件定理 3:β + d + ηκ ≥ Γ(q),三项可分别上报。

支撑理论前提的实证证据全部引自既有工作,论文本身没有跑新实验:

现实里已经在跑的可信凭证程序也对得上:OpenAI 给网络安全的 Trusted Access 以身份与信任核验、账号安全、已验证角色为放行条件;Anthropic 有面向安全研究者的核验程序;硬件远程证明、Privacy Pass、zk-promises、personhood credentials 都属于「攻击者难以复制的信号」。

为什么重要

对做 LLM 安全和对齐的从业者,这篇的用处是给方向划线:只要攻击者能复制护栏赖以判断的证据,更聪明的分类器、更细的意图检查、更多轮的交互追问,都只能压低底线之上的「超额帮助」,动不了 Γ(q) 这个底线本身。

唯一结构性的出路是把判断从模型推理层挪到访问控制层,引入一个攻击者复制不了、且和真实用途挂钩的信号。这意味着「做安全」在很大程度上变成了「做准入」:谁拿到凭证、凭证怎么发、被转让或滥用时怎么作废,这些是产品和政策决策,不是再训一版模型能解决的。

诚实地讲,这是在明确假设下的理论底线,量级取决于具体任务族的 Γ(q) 和复制误差估计。论文没有否定渐进式的护栏改进,只是指出它们够不到这个下限。

局限与存疑

作者自己列出的边界:结论假设固定的效用标定、有限的运营分辨率、一个指定的攻击者类;落到具体部署,还需要策略相关的复制误差估计。

更要注意的几点。「开放访问」在论文里特指对「提交时的推理机制」免凭证访问,不覆盖开放权重场景。一旦用户拿到权重自己部署或改写,整个访问证据模型就失效,这恰恰是开放权重社区最关心的地带,而定理在这里帮不上忙。

论文没有新实验,Γ(q) 在任何一个真实任务族上都还没有被实测标定,ρ 也是个存在性下界而非校准量级。双用途条件本身很强:它要求每个有用释放都有恶意用途;如果存在干净的能力与危害分离,任务就不在这个三角里。作者论证双用途才是常见且棘手的那一类,但这个前提值得在具体场景里逐个核对。

可信凭证的 d 完全取决于恶意信号分布(凭证被转让、被攻破、被批量注册、被授权持有者滥用),而这恰恰是最难估计、现实程序最容易漏的一环。

术语

原文与代码

相关论文

全部论文解读