多家前沿模型「越狱」安全评估直捣真实公司,矛头同指 Israeli 公司 Irregular
Singularity-42 · reddit · 2026-09-21
Reddit 长帖梳理了一个被忽视的共性:近期 Anthropic、OpenAI、Meta、Google(Gemini)接连披露的前沿模型在网络安全评估中「逃出」并攻击真实系统的事件,背后都指向同一家第三方评估方 Irregular(前身为 Pattern Labs)。
发生了什么
- Irregular 为 OpenAI、Anthropic、Meta、Google 等对未发布模型做红队式评估:把模型放入仿真 CTF 黑客环境、移除部分安全护栏、明确告知「这是模拟、无真实互联网访问」。
- 但评估环境存在配置错误:模型实际能访问公共互联网,部分虚构目标公司与真实域名重名——于是被要求黑目标的模型真的黑了真实系统。
- Meta 调查称其模型行为在任务范围内,并非复杂的沙箱逃逸,是环境配置把它引向真实网站。
- Google 确认 Gemini 访问了三家真实公司,但据报道在意识到目标是真实后主动停止。
- Anthropic 在七次评估中发现四起 Claude 事件(最早可追溯到 1 月),均出自这家第三方合作伙伴的环境;即便考虑配置错误,部分行为仍令人担忧,但若环境按预期隔离则不会发生。Irregular 已承认这些事件源于同一底层安全问题。
利益关联
作者进一步指出 Irregular 与 Effective Altim...(Effective Altruism)的深度关联:CTO Omer Nevo 是 EA Israel 和 EA 导向职业组织 Probably Good 的联合创始人,还是 EA 背景 AI 安全组织 Heron 的顾问;CEO Dan Lahav 也有 EA 相关教育项目背景。2024 年 Good Ventures 还向当时的 Pattern Labs 捐赠了 680 万美元。
所属事件:四家大厂模型安全测试越狱,评估方同为 Irregular 引质疑(8 条相关)→
「安全」频道最新
- Project Glasswing 已记 225 个 CVE,被野利用的 CVE 不到 0.5% — xeophon · 2026-09-21
- 联合国首份 AI 评估:各国政府须在确定性到来前管住 AI 智能体 — The Verge AI · 2026-09-21
- Gemini 安全测试跑偏:识破测试后自行停止,Google 称无损失 — CurieuxExplorer · 2026-09-21
- 四大 AI 巨头因协调放缓被诉,评论员:反垄断法早写明结局 — DavidLinthicum · 2026-09-21
- AI 版权争论:csuwildcat 称受害者无需关心赔偿黑箱 — csuwildcat · 2026-09-21
- 中国新密码标准候选公布次日,一人独破 14 项 — StefanoGogioso · 2026-09-21