新博客首发:为何缓解 AI 越狱几乎不可能

karen_ullrich · x · 2026-08-19

Karen Ullrich 推出了新博客《AI Reliability Review》,专注于从技术、实证和社会三个角度撰写 AI 可靠性。首篇文章《On the Impossibility of Mitigating AI Jailbreaks》探讨了越狱、对齐与系统控制的关系,论证了缓解越狱的难度。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →