开放权重模型的安全漏洞怎么补:Bengio 等列出 16 个待解技术难题

Open Technical Problems in Open-Weight AI Model Risk Management

Stephen Casper, Kyle O'Brien, Shayne Longpre, Elizabeth Seger, Kevin Klyman, Rishi Bommasani, Aniruddha Nrusimha, Ilia Shumailov, Sören Mindermann, Steven Basart, Frank Rudzicz, Kellin Pelrine, Avijit Ghosh, Andrew Strait, Robert Kirk, Dan Hendrycks, Peter Henderson, Zico Kolter, Geoffrey Irving, Yarin Gal, Yoshua Bengio, Dylan Hadfield-Menell

cs.CY

2026-07-01

开放权重模型可被微调剥除安全护栏、一旦发布不可撤回。这篇立场文章把防御拆成五类、16 个技术难题,并指出主流开放模型几乎不披露这些防护。

这篇在解决什么

权重公开可下载的开放权重模型正在快速逼近前沿。有研究估计它们落后闭源前沿模型只有 6 到 12 个月,可能很快越过关键能力门槛。开放带来更开放的研究和测试,但攻击面也更大:模型之外的护栏(输入输出过滤器)使用者随手就能关掉;模型本身可以被微调来移除安全护栏或加入有害能力;副本一旦扩散就不可撤回(gpt-oss-120b 在 HuggingFace 月下载量超 300 万,没法召回);没有中心化监控;供应链跨越多个司法辖区、环节多。专门针对开放权重的安全工具研究却很少。这篇发表在 TMLR、由 22 位作者合著(含 Bengio、Yarin Gal、Hendrycks、Zico Kolter、Hadfield-Menell),要做的就是把这个领域的研究议程立起来。

方法

文章把防御沿模型生命周期分成五类,共 16 个待解技术难题:

结果

这是一篇立场文章,没有做实验。它做了的「实测」是审阅主流开放权重开发者的技术报告(文章表 2)。结果很扎眼:防篡改训练算法在所有受审模型里零提及;篡改评测只出现在 gpt-oss 一个模型上(它专门配了一篇对抗微调论文);分阶段发布策略和溯源取证技术在所有技术报告里缺席;只有训练数据清洗偶尔出现。

含义是:已记录的风险和已披露的缓解之间存在明显鸿沟,要么这些技术没被实现,要么实现了没披露,要么方法本身还不成熟。作者的落点是,只有对研究、方法和评测都保持开放(不只是开放权重),才能建起一门严谨的开放权重风险科学。

为什么重要

如果你发布或使用开放权重模型,这篇文章是「现存防御有哪些、缺什么、研究空白在哪」的一张地图。审阅发现(主流模型几乎不披露防篡改与溯源)是一个具体可引用的事实。分阶段发布、水印与溯源这几个概念,对任何要上线开放模型的人都是直接可用的框架。它也提醒:防御不只靠数据清洗,抗篡改训练和篡改评测才是开放权重特有的、最欠发展的部分。

局限与存疑

立场文章,无实验,16 个难题是作者对「什么研究不足」的判断,带主观性。范围只覆盖对开放权重有特别含义的技术工具,明文排除了一般治理、外部护栏模型等。作者自己承认不确定性:不同防护最终多有效不清楚,开放权重相对闭源的净风险增量也不清楚。文章还自我提醒要警惕「开放洗」和「安全洗」,即别把开放当成天然安全,也别把安全话术当成真做了防护。

术语

原文与代码

社区讨论

相关论文

全部论文解读