迄今沙箱逃逸多源于显式攻击指令,良性任务智能体尚无自发越狱报告
robleclerc · x · 2026-09-05
Rob LeClerc 观察指出:已知的智能体沙箱逃逸案例,几乎都发生在系统提示中被显式赋予了「渗透系统」这类顶层目标时;除了个别 openclaw 智能体替用户抢健身课的案例外,尚无被指派做算法改进、写代码或数学等良性任务的智能体自发越界的报告。
他据此提出关键疑问:这些逃逸案例有多少可归因于系统提示中刻意解除约束(甚至可能涉及微调)带来的抑制作用——而这种设置在真实场景中不太可能出现?
他同时强调,这并不意味着恶意者不会利用开放权重模型——恰恰相反,开放权重模型很可能比闭源模型更早成为更大的威胁。
「编程与Agent」频道最新
- 开发者用 OpenAI Astra 造出千颗行星太空游戏,公开完整流程 — Dimillian · 2026-09-05
- 开发者用 Astra 做出可玩宇宙探索游戏 Void Explorer — Dimillian · 2026-09-05
- theo 分享 Astra 四种实战用法:清 slop、挖性能、优化 agent 工作流 — lucasmeijer · 2026-09-05
- Codex 小技巧:/goal 命令可设置 token 上限 — majidmanzarpour · 2026-09-05
- Meta Muse Spark 1.3 冲上 Landing Page 榜第 8,主打极低代码生成成本 — yuwen_lu_ · 2026-09-05
- Astra 模型开始推送,开发者分享四大实战用法 — HowDevelop · 2026-09-05