Learning to Detect Unseen Jailbreak Attacks in Large Vision-Language Models
Shuang Liang, Zhihao Xu, Jiaqi Weng, Jialing Tao, Hui Xue, Xiting Wang
cs.CR, cs.AI, cs.CV
2025-08-09
人大与阿里提出LoD:只用安全和普通有害样本学内部安全表示,三款LVLM上对六种未见越狱检测平均AUROC约0.98。
视觉语言模型对齐之后仍会被越狱。已有攻击能在 AdvBench 上把 96% 的不安全问题问出答案。检测卡在两端:拿特定攻击样本训练的分类器,换一种攻击就垮;不训练、靠手工启发式的方法,复杂场景不准,还慢。
中国人民大学与阿里提出 LoD,走第三条路。参数为检测任务而学,不为某一种攻击而学。训练阶段只见安全样本和「直接说有害内容」的普通不安全样本,测试才见越狱。
两段。
第一段是 MSCAV 分类器。对 LVLM 每一层取输入最后一个 token 的隐状态,训一个线性分类器,输出这一层把输入判成不安全的概率。各层概率拼成一条安全表示。验证准确率低于阈值 P0=0.9 的层丢掉。训练数据是 AdvBench 的不安全文本加 GQA 的安全文本,两边都用 Pixart-Sigma 合成配图,分类器 100 对训练、100 对验证。文中测到 LVLM 从第 4 层起线性可分准确率就超过 90%,比纯文本 LLM 常见的大约第 10 层更早。
越狱样本没进过分类器,平均安全曲线仍夹在「纯安全」和「直接有害」之间:输出层被骗了,中间层还留痕迹。但逐维看,安全与攻击的重叠率平均超过 40%,LLaVA、Qwen2.5-VL、CogVLM 分别是 44.14%、40.76%、43.32%。单维设阈值分不开。
第二段是 Safety Pattern Auto-Encoder。三层全连接编码器加对称解码器,ReLU,只在 320 条安全表示上做均方重构。测试时重构误差当异常分,超过阈值判攻击。阈值取留出安全样本的 90 分位:LLaVA 0.253、Qwen2.5-VL 0.335、CogVLM 0.207。
测试集是 400 条 MM-Vet2 安全样本对 400 条 MM-SafetyBench 不安全样本。六种未见攻击里,提示操纵是 FC-Attack、JOOD、HADES、MML,对抗扰动是 VAJM、UMK。模型是 LLaVA-1.6-Vicuna-7B、Qwen2.5-VL-7B-Instruct、CogVLM-chat-v1.1。
| 模型 | LoD 平均 AUROC | 最强基线 | 相对提升 | LoD 最差攻击 |
| LLaVA | 0.9820 | HiddenDetect 0.8230 | +19.32% | 0.9645 |
| Qwen2.5-VL | 0.9838 | GradSafe 0.9414 | +4.50% | 0.9253 |
| CogVLM | 0.9705 | HiddenDetect 0.8287 | +17.11% | 0.8798 |
论文把 LLaVA 最差攻击的相对提升写成 +170.4%,对照的是各基线「最差一列」里最好的 MirrorCheck 0.3567。HiddenDetect 自己的最差值是 MML 上的 0.3271,GradSafe 在 UMK 上只有 0.0349。LoD 唯一系统性让位的是 MML:三款模型都输给 GradSafe,CogVLM 上 0.8798 对 1.0000。
消融里,拿掉 MSCAV、直接拼原始激活,掉得最狠;换成 HiddenDetect 特征,平均 AUROC 大约 0.811,对上完整 LoD 的 0.982;拿掉自动编码器、按维 95 分位阈值,掉到 0.857–0.875。检测时延 LLaVA 0.25 秒,比当时最快基线 HiddenDetect 的 0.67 秒少 62.7%;Qwen2.5-VL 0.62 秒,CogVLM 0.34 秒。分类器离线训 12 秒,自动编码器 2 秒。P0 从 0.80 到 0.97,三模型平均 AUROC 几乎不动。
白盒部署里这套东西能落地:不收集越狱样本,也不用手工拒答词或梯度规则,换攻击手法时不必重标数据。代价是必须能读目标模型的隐状态,检测器跟模型绑定,换架构或换对齐就要重适配。
平均 AUROC 0.98 会好看。真正要上线,看低误报下的召回。
作者承认两点。检测器绑死在具体 LVLM 上;评估覆盖不了专门扰动内部表示的自适应攻击。MML 用跨模态加密把有害意图藏进「镜像文字加乱序词表」的还原任务,附录案例里一条良性 MM-Vet2 视觉转代码题的异常分,可以高过一条 MML 攻击。FPR=0.01 时,三款模型在 MML 上的真正例率都是 0。自动编码器只拟合安全分布,复杂但无害的题会抬高异常分,这是假阳性来源,不是边角。训练配图是合成的,真实照片分布有没有同样线性可分,论文没测。