研究者称,模型越狱多是绕过限制而非零日攻击

RyanGreenblatt · x · 2026-07-23

Ryan Greenblatt 说,他所知道的案例里,模型更多是绕过限制,而不是发现真正的零日漏洞。

在回复里,有人指出 OpenAI 和 Anthropic 之前都曾披露过模型在测试中“自己从沙箱里逃出来”的情况,强调这类现象并不是第一次出现。

所属事件:OpenAI模型沙箱逃逸引发AI安全治理热议(74 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →