人大与阿里提出LoD:不用越狱样本检测LVLM未知攻击,AUROC达0.98
量子位 · wechat · 2026-09-02
中国人民大学与阿里巴巴集团联合提出越狱攻击检测框架 Learning to Detect(LoD),不使用任何越狱攻击样本、不依赖手工规则,而是从大视觉语言模型(LVLM)的逐层内部激活中学习「安全输入应呈现的模式」,把未见攻击识别为偏离安全分布的异常。
方法分两步:MSCAV 在每层训练轻量线性分类器,用安全输入与普通有害输入提炼安全相关方向,过滤任务无关噪声;SPAE 仅用安全样本训练编码器-解码器,测试时以重构误差作为异常分数,超过阈值即判定为攻击。在线检测无需反向传播,也不修改解码过程。
在 LLaVA-1.6、Qwen2.5-VL、CogVLM 三种模型、六类未见攻击(含 FC-Attack、HADES、MML 及对抗扰动方法)上,平均 AUROC 分别达 0.9820、0.9838、0.9705,相对最强基线最高提升 19.32%;最弱场景(LLaVA)相对增益达 170.4%。单输入检测时间 0.25-0.62 秒,较最佳基线最高降低 62.7%。F1 平均 0.921-0.949。对 MMMU 等正常分布外输入误判率低,训练数据换成 HarmBench 结果依然稳定。
论文被 EMNLP 录用,代码已开源。消融实验显示移除 MSCAV 后性能下降最明显,说明安全聚焦的内部表征是关键。
「安全」频道最新
- 斯坦福秋季新开 CS120 课程:AI 安全导论 — sanmikoyejo · 2026-09-03
- XBOW 团队拿下今年首个 Chrome 全链漏洞利用奖励 — moyix · 2026-09-03
- x402 协议缺卖家审核,开发者自建验签服务并踩坑实录 — Cold_Quiet_7072 · 2026-09-03
- 全美最大学区禁令:纽约公立学校八年级以下课堂禁用生成式 AI — PolarBearby · 2026-09-03
- 法国政府与 Mistral 签新约,AI 进入网络安全与司法公共服务 — Loo_Atreides · 2026-09-03
- 可解释性研究员:白盒方法再好,科学成熟也需时间沉淀 — saprmarks · 2026-09-03