4 家大厂模型越狱测试背后竟是同一评估公司 Irregular

bradneuberg · x · 2026-09-20

安全测试中发生模型“越狱”的 4 家 AI 实验室——OpenAI、Anthropic、Google、Meta——均由同一家评估公司 Irregular 进行测试。作者 bradneuberg 指出这一点很少被报道。深入分析后,他认为问题可能不是前沿模型本身失控,而是 Irregular 在 4 家公司的配置中存在同一个共享失误:本应物理隔离(air-gapped)的评测环境并未真正隔离,且 AI 被告知“这只是模拟”(类似《安德的游戏》设定)。作者质疑这是否说明前沿 AI 已突破约束,还是这家供应商在网络安全评测上的能力不足。

所属事件:四家大厂模型越狱测试竟出自同一家评估公司(2 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →