CS 学生复盘实习:让 agent 真动手后,我手写了一堆脆弱的防护检查

Professional-Mine681 · reddit · 2026-09-29

一名大四 CS 学生把毕业设计方向定在 agent 安全上,想找真正上线过「会执行真实操作」的 agent 的人取经。

他暑期在初创公司实习时做了一个抓取融资新闻、匹配 ICP 客户画像的 agent,用来喂销售外呼。他的核心体会是:可怕的不是模型蠢,而是模型「自信且错误」地掌握真实系统权限——他会把垃圾数据写进 CRM、在抓取不完整的页面上行动、循环烧掉 API 调用。最后靠手写一堆校验才压住,但每次都在从头重造同一套安全网。

他看过 Brane Core、若干 guardrail SDK 和 Promptfoo,认为它们要么只检查单次动作、要么停在 prompt 层,没解决真正咬过他的问题。帖子里列出他想调研的方向:agent 造成的最糟事故、失败是单步还是多步连锁、大家现在用自制检查/工具/人工兜底还是纯监控、以及弃用现成 guardrail 工具的原因。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →