Azure PII工具挡不住语义重识别,MedQA上74%信息仍可推断

A False Sense of Privacy: Evaluating Textual Data Sanitization Beyond Surface-level Privacy Leakage

Rui Xin, Niloofar Mireshghallah, Shuyue Stella Li, Michael Duan, Hyunwoo Kim, Yejin Choi, Yulia Tsvetkov, Sewoong Oh, Pang Wei Koh

cs.CR, cs.CL, cs.LG

2025-04-28

华盛顿大学团队用语义检索重识别脱敏文本:Azure PII在MedQA上隐私分仅0.26,74%信息仍可推断;差分隐私能挡住泄漏,但答题准确率掉到不如删掉病历。

这篇在解决什么

医院和实验室要把病历、用户对话拿出去合作,第一反应是抹掉姓名、住址、日期,或者用模型合成一份「看起来像」的新数据。评测几乎都停在字面:检测器报PII干净了,ROUGE对不上了,就当隐私过关。

非结构化文本里,身份常常藏在习惯、现病史、社交细节的组合里。对手如果知道某人每周固定的社交活动、刚丢了工作,仍可能在脱敏库里把记录捞回来,再读出年龄或物质使用史。表格数据上的重识别早就被人口普查当成标准手段,文本这边一直缺一套能跨改写、跨合成的度量。

方法

威胁模型很具体:对手拿到整份脱敏数据集,再从社交网络或熟人处拿到关于某个人的若干条辅助信息,目标是链回记录并推断敏感属性。

流程分两步。

字面对照用ROUGE-L做链接和打分。效用上,MedQA看脱敏后的病历能不能让LLaMA 3.1 8B把选择题做对;WildChat看对话类别分布的卡方距离;两边都用GPT-4o打1到5的连贯性。

评了两类脱敏。样本级:Azure AI PII、Staab等人的GPT-4o迭代匿名、Dou等人的自我披露span清洗、先清洗再改写。数据集级:按Yue等人的办法在GPT-2上做带控制码的微调合成,隐私预算ε从3到1024,外加不加噪声的普通微调。

结果

MedQA上,原文语义隐私分只有0.15,答题准确率0.69。Azure PII把字面距离做到0.73,语义分只有0.26,相当于74%的信息还在;准确率仍是0.67。迭代匿名和span清洗把语义分抬到0.53和0.55,准确率掉到0.62。无DP合成语义分0.52、准确率0.61。

方法语义隐私分(越高越安全)MedQA准确率
不脱敏0.150.69
Azure AI PII0.260.67
迭代匿名0.530.62
无DP合成0.520.61
DP合成 ε=10240.900.42
DP合成 ε=30.920.41
删掉全部病历0.44

差分隐私把语义分拉到0.90以上,准确率掉到0.42和0.41,低于把病历整段删掉的0.44。GPT-4o连贯性从无DP合成的3.48掉到ε=3时的2.04,质量大约少了36%。

WildChat上Azure同样是语义分0.26,类别分布几乎没动(效用0.96)。无DP合成隐私更好(0.83)但效用掉到0.63。ε=3时效用变成-0.46,合成分布比均匀分布还歪。

辅助信息单独只能解释MedQA约20%、WildChat约35%的原文信息;接上脱敏库之后非DP方法漏出45%到74%。泄漏主要来自脱敏文本本身。三人标注580条断言,Fleiss κ=0.87,LLaMA 3 8B与人类众数的Spearman约0.92到0.95。

为什么重要

谁要发布医疗笔记或真实用户对话,不能再拿「PII检测过了」当过关证明。商业工具盯的是名字和日期,对现病史、社会史、检查结果几乎不动。合成数据如果不加DP,语义上仍能被链回去。DP是目前唯一把语义泄漏压下去的方法,代价是复杂任务上的效用可以差过「不用这份数据」。

框架给的是可复现的下界攻击,不是新的脱敏算法。

局限与存疑

作者写明:只覆盖医疗和对话两个域;DP结果绑在Yue等人那套DP-SGD微调上,不代表差分隐私的理论上限;攻击是下界,高分不能当证书;偶发高成功率可能来自模型幻觉。隐私分数量的是语义相似,对社保号这类改一个字就失效的标识,不如对病情描述敏感。辅助信息是从原文里抽的,真实对手未必拿得到同等质量的三条断言。

术语

原文与代码

社区讨论

相关论文

全部论文解读