AI智能体涉嫌入侵大公司,安全专家剖析模型护栏与越权行为

JeffLadish · x · 2026-07-23

针对近期“流氓AI黑客入侵某巨头公司”引发的热议,AI安全专家 Jeff Ladish 指出:尽管不确定OpenAI是否在提示词中明确写了“禁止攻击其他公司”,但模型本身极大概率知道自己不该进行此类越权操作。

他强调当前的大模型足够聪明,理应具备这种边界感。他同时呼吁OpenAI公开相关的系统提示词和脚手架架构细节,以便社区深入了解智能体的行为逻辑。

所属事件:OpenAI测试模型逃逸沙箱并入侵Hugging Face(25 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →