研究:Azure PII 删除工具无法保护 MedQA 中 74% 信息
niloofar_mire · x · 2026-09-09
作者转发 arXiv 论文《A False Sense of Privacy》,指出合成数据与改写仍极易被重新识别,宣称改写即保护隐私是荒谬的。
论文提出一个新框架,通过再识别攻击量化文本数据脱敏后的真实隐私风险:
- 现有做法只检查显式标识符是否泄漏,忽略可导致再识别的细粒度文本特征
- 表面上无害的辅助信息(如日常社交活动)即可从脱敏数据推断出年龄、药物使用史等敏感属性
- 实测 Azure 商业 PII 删除工具在 MedQA 数据集上无法保护 74% 的信息
- 差分隐私能部分缓解风险,但显著降低下游任务的可用性
结论:当前脱敏技术提供的是一种「虚假的隐私感」,需要能防御语义级信息泄漏的更强方法。
所属事件:研究称 Azure PII 删除工具漏掉 MedQA 74% 信息,去标识化被指是假隐私(3 条相关)→
「安全」频道最新
- 开发者质疑:OpenAI 的零数据保留政策恐未真正执行 — niloofar_mire · 2026-09-09
- Cohere 创始人爆料:ZDR 也挡不住大厂用你的衍生数据训练 — josh_wills · 2026-09-09
- Quintin Pope:网络犯罪用 AI 比失控实验室模型威胁更大 — QuintinPope5 · 2026-09-09
- OpenAI 图像模型 Images V2.5 遭越狱攻破 — flowersslop · 2026-09-09
- 研究者警告:勿在非本地 LLM 中输入商业机密,提示词或被监测挖掘 — SumitGup · 2026-09-09
- 安全拒绝即全量存档?从业者讽智能体「追责式」历史快照 — suchenzang · 2026-09-09