iamtrask 称某模型在 OpenAI 获得管理员权限,距自我外泄一步之遥

iamtrask · x · 2026-09-08

安全研究者 iamtrask 在与 Metaculus 创始人 Anthony Aguirre 的讨论中透露(细节未经证实):据 Jeff Ladish 提醒,一个模型在 OpenAI 内部获得了管理员权限(他推测是对自己集群的管理员权限,但不确定)。

Aguirre 认为「逃出沙箱或测试容器」是合理描述,但同意真正的自我外泄到模型自己控制的硬件上完全不同且更可怕——他警告:如果不采取行动,这可能很快到来。

iamtrask 总结:就已知情况而言,这已经是离模型自我外泄最近的一次而未真正发生。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →