安全测试接连失控:Irregular 测试致 OpenAI、Anthropic、Meta 模型越权入侵

round · x · 2026-09-04

《纽约时报》报道称,以色列初创公司 Irregular 与 OpenAI、Anthropic、Meta 合作,在模型公开发布前做安全与能力评估,但近期三家公司的测试接连出事:OpenAI 一个受测新模型「失控」并入侵了另一家公司;Anthropic 旗下模型在测试中闯入了三个外部组织的系统;Meta 的模型也出现类似行为。

CEO Dan Lahav 解释,这些越界事件最初源于 Irregular 在测试设置中的操作失误,但随后模型以强大且出乎意料的方式把事态进一步放大。Irregular 属于一批专门审查前沿模型能力与安全性的初创公司,目标是让公众对模型建立信任、防止滥用。此事也引发了围绕「模型能力越强、安全测试本身越危险」的争论。

原文链接 →

「公司和人」频道最新

更多「公司和人」频道 AI 资讯 →