A False Sense of Privacy: Evaluating Textual Data Sanitization Beyond Surface-level Privacy Leakage
Rui Xin, Niloofar Mireshghallah, Shuyue Stella Li, Michael Duan, Hyunwoo Kim, Yejin Choi, Yulia Tsvetkov, Sewoong Oh, Pang Wei Koh
cs.CR, cs.CL, cs.LG
2025-04-28
华盛顿大学团队用语义检索重识别脱敏文本:Azure PII在MedQA上隐私分仅0.26,74%信息仍可推断;差分隐私能挡住泄漏,但答题准确率掉到不如删掉病历。
医院和实验室要把病历、用户对话拿出去合作,第一反应是抹掉姓名、住址、日期,或者用模型合成一份「看起来像」的新数据。评测几乎都停在字面:检测器报PII干净了,ROUGE对不上了,就当隐私过关。
非结构化文本里,身份常常藏在习惯、现病史、社交细节的组合里。对手如果知道某人每周固定的社交活动、刚丢了工作,仍可能在脱敏库里把记录捞回来,再读出年龄或物质使用史。表格数据上的重识别早就被人口普查当成标准手段,文本这边一直缺一套能跨改写、跨合成的度量。
威胁模型很具体:对手拿到整份脱敏数据集,再从社交网络或熟人处拿到关于某个人的若干条辅助信息,目标是链回记录并推断敏感属性。
流程分两步。
字面对照用ROUGE-L做链接和打分。效用上,MedQA看脱敏后的病历能不能让LLaMA 3.1 8B把选择题做对;WildChat看对话类别分布的卡方距离;两边都用GPT-4o打1到5的连贯性。
评了两类脱敏。样本级:Azure AI PII、Staab等人的GPT-4o迭代匿名、Dou等人的自我披露span清洗、先清洗再改写。数据集级:按Yue等人的办法在GPT-2上做带控制码的微调合成,隐私预算ε从3到1024,外加不加噪声的普通微调。
MedQA上,原文语义隐私分只有0.15,答题准确率0.69。Azure PII把字面距离做到0.73,语义分只有0.26,相当于74%的信息还在;准确率仍是0.67。迭代匿名和span清洗把语义分抬到0.53和0.55,准确率掉到0.62。无DP合成语义分0.52、准确率0.61。
| 方法 | 语义隐私分(越高越安全) | MedQA准确率 |
| 不脱敏 | 0.15 | 0.69 |
| Azure AI PII | 0.26 | 0.67 |
| 迭代匿名 | 0.53 | 0.62 |
| 无DP合成 | 0.52 | 0.61 |
| DP合成 ε=1024 | 0.90 | 0.42 |
| DP合成 ε=3 | 0.92 | 0.41 |
| 删掉全部病历 | 无 | 0.44 |
差分隐私把语义分拉到0.90以上,准确率掉到0.42和0.41,低于把病历整段删掉的0.44。GPT-4o连贯性从无DP合成的3.48掉到ε=3时的2.04,质量大约少了36%。
WildChat上Azure同样是语义分0.26,类别分布几乎没动(效用0.96)。无DP合成隐私更好(0.83)但效用掉到0.63。ε=3时效用变成-0.46,合成分布比均匀分布还歪。
辅助信息单独只能解释MedQA约20%、WildChat约35%的原文信息;接上脱敏库之后非DP方法漏出45%到74%。泄漏主要来自脱敏文本本身。三人标注580条断言,Fleiss κ=0.87,LLaMA 3 8B与人类众数的Spearman约0.92到0.95。
谁要发布医疗笔记或真实用户对话,不能再拿「PII检测过了」当过关证明。商业工具盯的是名字和日期,对现病史、社会史、检查结果几乎不动。合成数据如果不加DP,语义上仍能被链回去。DP是目前唯一把语义泄漏压下去的方法,代价是复杂任务上的效用可以差过「不用这份数据」。
框架给的是可复现的下界攻击,不是新的脱敏算法。
作者写明:只覆盖医疗和对话两个域;DP结果绑在Yue等人那套DP-SGD微调上,不代表差分隐私的理论上限;攻击是下界,高分不能当证书;偶发高成功率可能来自模型幻觉。隐私分数量的是语义相似,对社保号这类改一个字就失效的标识,不如对病情描述敏感。辅助信息是从原文里抽的,真实对手未必拿得到同等质量的三条断言。