Multimodal Model Diffing for Feature Discovery and Control
Hunar Batra, Lachin Naghashyar, Ashkan Khakzar, Philip Torr, Christian Schroeder de Witt, Constantin Venhoff, Ronald Clark
ICML 2026 Trustworthy AI for
cs.CV, cs.AI, cs.CL, cs.LG
2026-08-11
牛津团队对三个 MLLM 家族做多模态模型差分:用基座 LM 的 SAE 热启动再在多模态激活上训练,筛出被多模态训练改造过的特征;删掉单个特征使空间任务掉 12%、OCR 掉 17%,安全攻击成功率降 24%,VQA 不掉点。
多模态大模型能读图能定位能做空间推理,但哪些内部特征在支撑这些行为,审计和干预都够不着。稀疏自编码器(SAE)能把隐状态拆成稀疏特征方向,直接在 MLLM 上训的 SAE 却有个盲区:它分不清哪些特征是从语言基座继承的、哪些是被多模态训练改造过的。混在一起就既定位不到多模态新增的能力,也没法做定向控制。
MMDiff 的管线三步。
控制手段两种:因果删除(在所有层、仅文本 token 位置把该方向正交投影掉)和 MMDiff-CAA 导向(多层任务方向 + 在特征所属层注入其解码器方向)。
三个 MLLM 家族(LLaVA-MORE、PaliGemma 2、InternVL3.5)上:
| 操作 | 目标行为变化 | VQA 溢出 |
| 删空间特征(平均) | VSR -12% | -0.1% |
| 删 OCR 特征(5 个顶级均值) | OCRBench 类别 -16.9% | ≤1.6% |
| 删不安全特征(顶级) | VLSBench ASR -17.8-28.1% | ≤1% |
| 删不安全特征(1061 个候选均值) | ASR -9.67% | -0.03% |
| MMDiff-CAA 导向 vs 单层 CAA | 空间 +12.59 vs +8.96 |
每个被删特征都对应具体空间关系:删 L9/F15870 掉「right side of」15.5 个点,删 L21/F12020 掉自残类 ASR 28.1 个点。对照组干净:删同层随机特征 VSR 只动 0.5 个点,证明效果来自选出的方向本身。
消融把「差分到底重不重要」钉死了:去掉被改造特征筛选、只按发放频率选,空间掉分更大(-15.1)但 VQA 崩 25.9 个点,那是全局破坏不是定位干预;只用差分筛选不按发放选,VQA 无损但空间几乎不动(-1.0)。完整管线才同时做到有效和选择性。随机初始化(不热启动)的 SAE 没有可与基座对齐的索引,只能靠发放对比选,选出的头部特征删了 VSR 几乎不变,证明因果特征集拿不到,差分是必要组件。
归因分析还定位到具体注意力头(如 L13H1 在「on top of」类查询上盯住语义相关区域),自动解释给特征配了人话标签。
安全场景最直接:删六个类别各自的顶级不安全特征,攻击成功率掉 1728 个点,VQA 与良性控制集都不掉,这是不用重训就能压多模态越狱的干预手段。审计场景上,「哪些能力是多模态训练新给的、哪些是基座就有的」第一次有了可操作的回答,跨阶段消融显示 PaliGemma 2 的中层空间特征主要在多模态微调阶段习得。可解释性研究多了一套可复用的特征级接口,代码和 SAE 都开源。
作者自己列了三条:安全和 OCR 实验只在 PaliGemma 2(2B 底座)上做,8B 与更大底座、MoE 架构没碰;MMDiff-CAA 需要同时拿到基座和指令微调版两个模型,只有其一时退化成普通 SAE 导向;少数不安全特征被删后模型直接胡言乱语而不是拒答,得靠事后过滤剔除。另外值得注意:12%/17% 的「平均削减」里方差不小,空间单特征最高 30.6、OCR 单特征最高 28.0,但也有不少特征接近零;正文没有给出特征级效应的完整分布。评测集中在 2B 级小模型,结论向大模型外推没有证据。