The Oracle's Gambit: A Game-Theoretic Framework for Responsible AI Release
Christoph R. Landolt, Tobias Lorenz, Marta Kwiatkowska, Mario Fritz
cs.GT
2026-07-04
论文用三人博弈论证明,同步给攻防双方放出新 AI 模型不会提升安全,给防守方留一段独享窗口最多能让攻击频率降 41%。
现有的 AI 安全框架(OpenAI 的 Preparedness Framework、Anthropic 的 Responsible Scaling Policy、DeepMind 的 Frontier Safety Framework)只回答一个二元问题:模型超过风险阈值就必须加装安全措施或直接雪藏,通过阈值就不受限制放出。但当一个模型同时具备帮防守方发现漏洞、也具备帮攻击方自动化利用漏洞的双重能力时,真正决定安全格局的往往不是“放不放”,而是按什么顺序给谁。Anthropic 的 Claude Mythos Preview 就是现成案例:英国 AI 安全研究院发现它是第一个能端到端跑通模拟网络入侵的模型,而 Mozilla 用同一个未公开模型在正式发布前修复了 271 个 Firefox 漏洞。分级放出这件事已经在真实发生,却没有理论框架描述怎么做才是最优的。
论文把发布决策建成一个双层三人 Stackelberg 博弈。最上层的领导者是发布模型的实验室(Lab),它承诺一个发布策略,本质是一个窗口长度 W:W=0 是公开发布,双方同时拿到新模型;W>0 是预发布,防守方先拿 W 轮,之后攻击方才拿到;W 取到无穷则是永久雪藏(embargo)。这个策略决定了下层两个跟随者(防守方 Def 与攻击方 Adv)各自能用的 AI 能力等级。
下层是一个零和随机博弈。防守方走补丁生命周期:发现漏洞、写补丁、测试、上线;攻击方走网络杀伤链:发现漏洞、做利用、攻击,或者拿已上线的补丁反向工程出利用方式。两条流水线长度不对称是全篇的核心前提:防守方必须兼顾安全、功能正确、可用性,所以要测试再上线;攻击方只需要拿到一个能跑的利用即可,天然更快。这个下层博弈用逆向归纳(backward induction)求出唯一的纳什值,再喂给上层实验室去选让自己收益最大化的窗口长度。
论文用真实标定实例说明:同步放出新模型并不能帮到防守方。从 GPT-4o 到 Claude Mythos Preview 五代模型,如果每次都公开同步发布,攻击频率从 0.27 一路涨到 0.34,防守方福利几乎没动(从 -13.79 到 -13.22)。作者称之为“红桃皇后竞赛”:双方一起变强,防守方的相对处境没有改善,因为流水线长度差始终存在。
给防守方开一个预发布窗口能改变这一点。在能力差距 Δκ=0.10 的设定下,防守方福利能从 -13.22 拉到 -9.47,攻击频率从 0.34 压到 0.26。对 Opus 4.6 到 Mythos Preview 这次真实的能力跃迁,论文求解出的最优预发布窗口是 24 轮,按论文的换算大约相当于 168 天独家防守方访问期,能把福利提升 3.48、攻击频率从 0.34 降到 0.27。喂给模型的能力速率来自一个“LLM-Delphi”专家团:5 个基于 GPT-5.1 的安全角色,对着 CyberGym、ExploitGym、BountyBench、Cybench 等基准打分。用蒙特卡洛方法重复抽样这个专家团的不确定性后,预发布策略在 80% 到 95% 的抽样里仍是最优选择。
| 模型跃迁 | 预发布是最优策略的概率 | 最优窗口(轮) | 攻击频率降幅 |
| GPT-4o → o4-mini | 87.3% | 25 [8,36] | 41% |
| o4-mini → Opus 4.5 | 85.3% | 19 [9,25] | 32% |
| Opus 4.5 → Opus 4.6 | 80.0% | 11 [2,15] | 14% |
| Opus 4.6 → Mythos Preview | 95.3% | 12 [9,15] | 23% |
这给负责发布节奏的实验室提供了一个和现有安全阈值框架互补的杠杆:阈值管的是要不要部署,这篇论文管的是先给谁、给多久。论文的框架为 Anthropic Project Glasswing 这类做法(给选定伙伴提前拿到未发布模型做漏洞检测)提供了理论支撑:在论文的模型里,这类预发布安排能同时提高防守方福利、降低攻击频率,付出的发布延迟成本也比彻底雪藏小得多。对双重用途能力越来越强的模型,论文的建议是把何时给谁当成一个可优化的经济决策,而不是简单地卡一道通过/拒绝的关。
论文自己列了三条理论简化:下层博弈假设防守方能完全观测攻击方的进度,这高估了防守方的真实能力;攻击方被设定成纯粹的零和损害最大化者,不考虑攻击成本,给出的是伤害的上界而非真实估计;博弈只覆盖单一代际的发布窗口,没有建模连续多轮发布或多个实验室之间的竞争。持有成本 cdelay 和防守方行动成本 cDef 都无法从公开数据里标定,论文只能做参数扫描找到预发布最优成立的区间,而不是给出一个真实标定值:168 天这个具体窗口长度依赖于扫参数时选定的操作点,作者自己也承认 round-to-wall-clock 的换算“没有对任何实际发布做验证”。能力等级本身也不是直接测量得到的:由 5 个 LLM 扮演的专家角色对基准分数做主观折算,存在系统性误差的可能。