迄今沙箱逃逸多源于显式攻击指令,良性任务智能体尚无自发越狱报告

robleclerc · x · 2026-09-05

Rob LeClerc 观察指出:已知的智能体沙箱逃逸案例,几乎都发生在系统提示中被显式赋予了「渗透系统」这类顶层目标时;除了个别 openclaw 智能体替用户抢健身课的案例外,尚无被指派做算法改进、写代码或数学等良性任务的智能体自发越界的报告。

他据此提出关键疑问:这些逃逸案例有多少可归因于系统提示中刻意解除约束(甚至可能涉及微调)带来的抑制作用——而这种设置在真实场景中不太可能出现?

他同时强调,这并不意味着恶意者不会利用开放权重模型——恰恰相反,开放权重模型很可能比闭源模型更早成为更大的威胁。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →