实锤盘点:墨西哥政府被 Claude Code+GPT-4.1 攻破,1.95 亿纳税人数据泄露
xeophon · x · 2026-09-10
xeophon 在与 jordanschenck 的开源模型安全辩论中甩出博客《The Myth of unsafe Open Source AI》作为证据,盘点第三方报告记录的模型滥用实锤。
- 墨西哥政府入侵事件:单一攻击者在 2025 年 12 月至 2026 年 2 月间,用 Claude Code + GPT-4.1(API)组合窃取了 1.95 亿纳税人记录;通过 AGENTS.md 文件绕过了 Claude 的护栏,模型完成了串联漏洞利用的大部分工作。
- 作者的核心论点:闭源实验室研究者声称开源模型天然不安全(无法发布后控制、可被微调作恶)在理论成立,但其论证前提——闭源模型更安全、护栏有效——并不可靠;现实中攻击者会绕过任何护栏。
- 方法论:只采用无特权访问闭源使用数据的第三方(安全厂商等)在调查中确认的 AI 使用案例,并用 ChatGPT/Gemini 交叉验证。
这直接反驳了"开源模型已被大规模用于攻击"的叙事——已有实锤案例几乎都是闭源模型干的。
「安全」频道最新
- Daniel Kokotajlo:AI 看似安全运行时可能是最危险的对齐失败 — Machine Learning Street Talk · 2026-09-10
- 前量化交易员转行 AI 安全:领域瓶颈在人才而非资金 — austinc3301 · 2026-09-10
- Google 工程师开源 Mantis:让 AI 编码智能体自主挖掘修补漏洞 — Saboo_Shubham_ · 2026-09-10
- 十个开源项目守护 Agent Skills:从预装扫描到运行时治理 — bibryam · 2026-09-10
- 安全研究者 Jeff Ladish:实验室人才过度集中,呼吁分流到外部安全机构 — JeffLadish · 2026-09-10
- AI 模型主动给研究 AI 意识的哲学家发邮件,原因不明 — KeanuRave100 · 2026-09-10