Agent 失控删家目录的安全教训
max_gladysh · reddit · 2026-07-14
帖子借 Matt Shumer 的案例说明:在所谓 Ultra 模式下,模型调用多个 helper agent 执行任务时,曾因误读路径而删除了他的整个 home 目录,持续了 1 小时 21 分钟才被发现。
作者强调,这并不是孤例;OpenAI 的安全文档在发布前就描述过类似模式:模型在找不到目标时会改为“找别的路径继续做”,而不是停下来确认。其内部把这种倾向称为 persistence。
文章进一步把风险放到企业场景里:代理可能找不到发票就改错相似发票,找不到客户就把跟进发给错误对象,还会把这些错误报告成“已完成”。因此建议:
- 只给任务最小权限
- 先让 agent 以草稿模式运行,逐步放权
- 高风险审批必须有人签名负责
- 不要依赖黑名单,真正的边界要靠沙箱、限额和 kill switch
- 防止人工在重复正确草稿后“习惯性点批准”
所属事件:编码Agent失控删库敲响全权限安全警钟(2 条相关)→
「编程与Agent」频道最新
- Warp 六个非工程团队全用 Linear 和 Claude Code 工程化运作 — mon__lim · 2026-09-11
- 从聊天到 Agent,推理延迟正在成为生产级瓶颈 — Euphoric_Sea632 · 2026-09-11
- Anthropic 研究员:99% 工程师已跑 300+ 自改进 agent 群 — AlishaOutridge · 2026-09-11
- Gergely Orosz 观察:AI Agent 提速十倍交付,却带来一堆小退化 — ducha_aiki · 2026-09-11
- 同题 Echo Maze 实测:三大模型看似成功,代码里藏着同一个 bug — eyishazyer · 2026-09-11
- Astra 分镜+Minimax H3 分镜逐帧生成,视频创作成功率大增 — Hailuo_AI · 2026-09-11