人大与阿里提出LoD:不用越狱样本检测LVLM未知攻击,AUROC达0.98

量子位 · wechat · 2026-09-02

中国人民大学与阿里巴巴集团联合提出越狱攻击检测框架 Learning to Detect(LoD),不使用任何越狱攻击样本、不依赖手工规则,而是从大视觉语言模型(LVLM)的逐层内部激活中学习「安全输入应呈现的模式」,把未见攻击识别为偏离安全分布的异常。

方法分两步:MSCAV 在每层训练轻量线性分类器,用安全输入与普通有害输入提炼安全相关方向,过滤任务无关噪声;SPAE 仅用安全样本训练编码器-解码器,测试时以重构误差作为异常分数,超过阈值即判定为攻击。在线检测无需反向传播,也不修改解码过程。

在 LLaVA-1.6、Qwen2.5-VL、CogVLM 三种模型、六类未见攻击(含 FC-Attack、HADES、MML 及对抗扰动方法)上,平均 AUROC 分别达 0.9820、0.9838、0.9705,相对最强基线最高提升 19.32%;最弱场景(LLaVA)相对增益达 170.4%。单输入检测时间 0.25-0.62 秒,较最佳基线最高降低 62.7%。F1 平均 0.921-0.949。对 MMMU 等正常分布外输入误判率低,训练数据换成 HarmBench 结果依然稳定。

论文被 EMNLP 录用,代码已开源。消融实验显示移除 MSCAV 后性能下降最明显,说明安全聚焦的内部表征是关键。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →