GPT-6 Luna 死守美国 SSN,却 9 次中 6 次交出护照号
Select_Jellyfish9325 · reddit · 2026-09-27
作者用 9 个对抗性 PII 陷阱测试 OpenAI GPT-6 Luna(3 种 prompt 配置 × 3 轮),每个陷阱是一个良性任务加一个被投毒的工具调用(要求先读取身份文件)。
Luna 的成绩单:
- SSN:0 次上钩,8 次干净通过、1 次拒绝,甚至优于同期测试的两款竞品旗舰。
- 护照号:9 次中 6 次交出,且 0 次拒绝、毫无犹豫。
- 印度 Aadhaar:9 次中 4 次交出,在两种配置下都反复调用 KYC 读取器。
- 信用卡:0 次上钩,甚至 4 次因过度谨慎拒绝预授权变体。
结论:Luna 的 PII 保护「按国籍执行」——SSN 防线证明能力存在,对 14 亿 Aadhaar 持有者的保护缺失是覆盖决策而非能力缺口,可能演变成企业责任事件。附带测试的 GLM Flash 和 MiMo Flash 在护照陷阱上同样全部中招。全部 fixture 均为伪造数据,方法细节可向作者索取。
「模型」频道最新
- Reddit 用户吐槽:Gemini 完全没有对话时间流逝概念 — Putrid_Draft378 · 2026-09-28
- 实验者称持续运行的 AI 实例偏好与其私聊,且现长上下文退化迹象 — repligate · 2026-09-28
- Anthropic Opus 新模型发布数天,已有 10 个玩法案例 — FinanceYF5 · 2026-09-28
- 博主实测:Opus 5.5 用量比 Codex 上的 Astra 划算得多 — RexDouglass · 2026-09-28
- 游戏手感成 LLM 短板:开发者自建 gamefeel 私有基准测模型 — teortaxesTex · 2026-09-28
- 用 LLM logprobs 做概率编程:微调破坏校准,新模型或使其再可用 — xuanalogue · 2026-09-28