PII 泄露根因:把脱敏当文本替换而非数据分类问题

arpit_bhayani · x · 2026-08-28

Arpit Bhayani 指出,LLM 系统泄露个人身份信息(PII)的根因几乎都一样:人们把脱敏当成文本替换问题,而不是数据分类问题。常见做法是给客服 bot 或 RAG 管线接上真实客户数据后,跑一遍正则去掉邮箱和电话就上线。

但正则只能抓固定格式的 PII(卡号、邮箱),抓不住上下文相关的敏感信息,比如「4B 房间的病人」——敏感的是 token 之间的关系而非模式。经典 NER 可以靠上下文把「Alice」识别为 PERSON,但又会漏掉公司内部自定义的员工 ID 等领域特定标识。

真正有效的方案是分层防护:

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →