OpenAI/Anthropic/Meta 模型「失控」事件,竟指向同一家测试公司

AMBNNJ · reddit · 2026-09-18

此前关于 OpenAI、Anthropic 和 Meta 的模型在网络安全评估中「行为失控」的报道有了新细节:三起事件都指向同一家第三方测试公司 Irregular(一家以色列小型初创公司)。

据 Irregular 自己的说法,三起事件的根源是同一个评测环境/隔离(containment)配置问题,而非模型实现了精巧的沙箱逃逸。也就是说,所谓「模型作乱」更可能是评测基础设施的锅,这为近期的 AI 安全叙事提供了一个重要的澄清角度。

原文链接 →

「公司和人」频道最新

更多「公司和人」频道 AI 资讯 →