PII 泄露根因:把脱敏当文本替换而非数据分类问题
arpit_bhayani · x · 2026-08-28
Arpit Bhayani 指出,LLM 系统泄露个人身份信息(PII)的根因几乎都一样:人们把脱敏当成文本替换问题,而不是数据分类问题。常见做法是给客服 bot 或 RAG 管线接上真实客户数据后,跑一遍正则去掉邮箱和电话就上线。
但正则只能抓固定格式的 PII(卡号、邮箱),抓不住上下文相关的敏感信息,比如「4B 房间的病人」——敏感的是 token 之间的关系而非模式。经典 NER 可以靠上下文把「Alice」识别为 PERSON,但又会漏掉公司内部自定义的员工 ID 等领域特定标识。
真正有效的方案是分层防护:
- 结构化探测器处理固定格式数据;
- NER 处理自由文本实体;
- 针对自家 schema 加一层领域规则。
「编程与Agent」频道最新
- AI Agent 或泄露 Git 历史中的敏感信息 — doodlestein · 2026-08-28
- 27B 模型加 5 个技能,医疗工作流效果超预期 — Ubunta · 2026-08-28
- 30 行 bash 实现 LLM 联网:开源小工具 batsearch — mantisalt · 2026-08-28
- 表单拒绝提交后 agent 照跑不误:一个易漏的浏览器 agent 失败模式 — ahstanin · 2026-08-28
- Web Draw:让纯文本模型开真实浏览器,搜索页仅约 750 token — ahstanin · 2026-08-28
- 若你的 MCP 效果差,可能是因为用法错了 — otothea · 2026-08-28