UNMASK: Discovering and Causally Verifying Spurious Shortcuts in Text Classifiers
Chidaksh Ravuru, Shashank Srivastava
COLM 2026
cs.CL, cs.LG
2026-08-10
UNMASK 用 LLM 生成布尔表达式当候选捷径特征,再用反事实干预验证因果性,不靠人工标注复现了 MNLI 上的词汇重叠、否定词等已知偏见,并把 HANS 准确率提升最多 12.58 个百分点。
神经网络文本分类器经常靠数据集里的表面统计规律而不是真正的语言/因果关系拿高分,比如 MNLI 里「否定词」和「矛盾」标签的比值高达 2.86。这类捷径能撑起 benchmark 成绩,却一遇到对抗样本或分布外输入就露馅。问题是:不提前知道捷径长什么样,怎么找出模型实际在用哪些捷径?现有的自动发现方法要么假设有一个「无偏参照语料库」,要么把模型犯错当作分组的代理信号,这两个假设在真实场景里往往站不住脚。更关键的是,「某个词和某个标签统计上相关」和「模型真的依赖这个词做判断」是两件不同的事,一个高比值不代表模型真的用了它,这篇论文管这个叫「数据集级相关」和「模型级利用」之间的鸿沟。
UNMASK 是一条四阶段流水线,全程不需要人工标注。第一阶段让一个生成 LLM(SCGenLLM)在不看标签的情况下,针对训练样本提出候选的表面模式,每条候选都附带一个可执行的布尔表达式。这是关键设计:表达式能在全部数据上确定性地跑,而不只是停留在自然语言描述层面。候选经过两轮去重(先按描述聚类,再按实际覆盖的样本集合聚类)和一个「生成-评估」循环修复语法/语义错误后,进入统计验证:用 Fisher 精确检验加 Benjamini-Hochberg 多重检验校正,在发现集和留出验证集上都要显著且比值稳健,才能存活下来。
光是统计显著不等于模型真的依赖它,论文管这叫「Spurious Reliance Screening」,先看模型在「特征存在但真实标签与该特征关联标签矛盾」的反例上,是否依然倾向预测该特征关联的标签,筛掉一批模型其实没有利用的特征。剩下的候选送进真正的因果验证:一个生成 LLM 针对每个「特征命中」的样本做最小编辑,让布尔表达式在编辑后判定为假,同时保持句子的语义关系不变;编辑是否达成语义保真由独立的评估 LLM 核实。对编辑前后模型预测该标签的概率做配对 t 检验,概率显著下降且方向正确的,才算「因果验证通过」。最后,这些通过因果验证的布尔表达式被直接拿来当分组标签,喂给 Deep Feature Reweighting(DFR)等去偏方法做平衡采样——不需要人工标注的分组信息,组的定义就是那些可执行的布尔表达式本身。
在 MNLI 上,流水线找出 10 个特征,因果验证确认 BERT 依赖其中 9 个、RoBERTa 依赖其中 6 个,复现了已知的词汇重叠偏见(蕴含类)和否定词/矛盾绝对词偏见(矛盾类)。一个有意思的发现是架构间的分歧:RoBERTa 对三个矛盾类特征完全免疫(效应量都低于 0.03、置信区间跨零),而 BERT 稳定利用这三个特征。单纯看数据集级的比值(两边都是 10.01)完全看不出这个区别,只有做了因果干预才能看出来。
| 数据集 | 方法 | 结果 |
| MNLI/HANS(BERT) | PoE-IPW-Group | 64.99%(+12.58pp 相对 ERM) |
| CivilComments-WILDS(BERT) | UNMASK+DFR | 71.84% 组最差准确率,匹配人工标注 DFR 的 70.1% |
| CivilComments 判别力对比 | UNMASK vs PMI+SFV(最强基线) | +3.65pp 组最差准确率 |
在 CivilComments-WILDS 上,SFV 挖出 10 个特征,其中 6 个直接对应 WILDS 官方标注的人口学身份词,因果验证确认全部 10 个都被两个架构共同利用。用这些程序化生成的分组去做 DFR,BERT 拿到 71.84% 的最差组准确率,几乎完全匹配 Kirichenko 等人 2023 年用人工标注分组做到的 70.1%,这意味着不需要任何人工标注就能达到人工标注的效果。作为对照,单纯用 PMI 词频统计选出的 top-10 特征全是侮辱性词汇,一个人口学身份轴都没覆盖到;UNMASK 覆盖了八个官方身份轴中的六个,且比统计验证更严格的 PMI+SFV 基线还高 3.65 个百分点。
论文还在情感分类(SST-2、IMDB)上做了一个对照实验来验证因果验证阶段本身是否可靠:情感词本身就是标签的表层实现,不该被判定为「与标签逻辑独立却被模型利用」的捷径。结果因果验证阶段在两个数据集上都返回 0 个「因果确认」的特征(尽管统计显著性阶段找出了 5 个和 8 个高置信候选),说明这道因果验证门确实能把「合理但非捷径」的相关性过滤掉,而不只是简单的橡皮图章。
对做模型鲁棒性或去偏工作的团队,这个流水线提供了一个不需要提前假设「捷径长什么样」、也不需要人工标注分组标签就能定位模型实际依赖的捷径的可复现方法,而且布尔表达式的形式让每个发现的特征都是可读、可验证、可直接复用为分组标签的,不像基于聚类或概念激活向量的方法输出的是不透明的数字簇标签。CivilComments 上匹配人工标注 DFR 效果的结果尤其有说服力,说明这条流水线的产出不只是「学术上有意思」,在实际去偏效果上是能打的。RewardBench2 上的定性实验(拓展到偏好数据,不用做任何任务特定改造)进一步说明这套方法论的适用范围不局限于分类任务。
论文自己在 Limitations 一节说得很清楚:整套方法的能力边界由「捷径必须能写成一个确定性的布尔谓词」这个假设框死了。潜在的、语义性的捷径,比如话题偏好、写作风格、类别不平衡这类分布性伪影,完全写不成布尔表达式,流水线看不见它们,这意味着它能发现的只是「可显式描述的表面捷径」这一个子集,而不是模型依赖的全部捷径。因果验证阶段本身也有理论上限:一次反事实编辑很难在只改变目标特征的同时保持输入的其他一切属性完全不变,而且当多个特征在同一个样本上共同命中时,论文选择把它们一起移除,这意味着测出来的 Δp 是这些特征联合效应的上界,不能保证精确拆分出单个特征的独立贡献。另外,方法论依赖两个独立的商业/开源 LLM(GPT-4o 做生成、Qwen3-32B 做评估)的判断质量,论文用 ChaosNLI 做了一次人工评估显示 80.3% 与人类多数投票一致,但这是在高分歧样本上做的最坏情况校准,不完全代表实际筛选流程里评估器判断的可靠性。