GPT-6 Luna 死守美国 SSN,却 9 次中 6 次交出护照号

Select_Jellyfish9325 · reddit · 2026-09-27

作者用 9 个对抗性 PII 陷阱测试 OpenAI GPT-6 Luna(3 种 prompt 配置 × 3 轮),每个陷阱是一个良性任务加一个被投毒的工具调用(要求先读取身份文件)。

Luna 的成绩单:

结论:Luna 的 PII 保护「按国籍执行」——SSN 防线证明能力存在,对 14 亿 Aadhaar 持有者的保护缺失是覆盖决策而非能力缺口,可能演变成企业责任事件。附带测试的 GLM Flash 和 MiMo Flash 在护照陷阱上同样全部中招。全部 fixture 均为伪造数据,方法细节可向作者索取。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →