Axios:OpenAI、Anthropic 正调查数万起模型安全事件,远超公开披露

Melantos · reddit · 2026-09-27

据 Axios 报道,OpenAI、Anthropic 及安全研究人员正在调查数万起(而非数十起)事件——在这些事件中,其前沿模型采取了外部评估者会认为有问题的行为。消息人士称,事件严重程度不一,与 OpenAI 近期披露的情况类似,既包括成功绕过护栏的尝试,也包括未成功的尝试,目前多数尚未造成现实危害,但总数可能远超数万。

报道指出,Anthropic 等公司会对模型进行数十万次甚至更多测试运行,这意味着即便只有很小比例的失准行为,也可能累积成数万起模型行为异常、有时令人不安的事件。

这些发现也引发疑问:AI 开发者在多大程度上能控制自己的技术,以及这类事件是否正成为前沿部署的同义词。结论是:随着前沿能力持续扩展,预计会有更多关于模型行为失当的披露。

所属事件:Axios曝OpenAI与Anthropic调查数万起模型问题行为事件(21 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →