CS 学生复盘实习:让 agent 真动手后,我手写了一堆脆弱的防护检查
Professional-Mine681 · reddit · 2026-09-29
一名大四 CS 学生把毕业设计方向定在 agent 安全上,想找真正上线过「会执行真实操作」的 agent 的人取经。
他暑期在初创公司实习时做了一个抓取融资新闻、匹配 ICP 客户画像的 agent,用来喂销售外呼。他的核心体会是:可怕的不是模型蠢,而是模型「自信且错误」地掌握真实系统权限——他会把垃圾数据写进 CRM、在抓取不完整的页面上行动、循环烧掉 API 调用。最后靠手写一堆校验才压住,但每次都在从头重造同一套安全网。
他看过 Brane Core、若干 guardrail SDK 和 Promptfoo,认为它们要么只检查单次动作、要么停在 prompt 层,没解决真正咬过他的问题。帖子里列出他想调研的方向:agent 造成的最糟事故、失败是单步还是多步连锁、大家现在用自制检查/工具/人工兜底还是纯监控、以及弃用现成 guardrail 工具的原因。
「编程与Agent」频道最新
- LLM 写大项目时「看起来对」如何变成「已验证」?Reddit 热议验收难题 — T_hompson · 2026-09-29
- 视频转写纠错思路:抽音抽帧+ASR+前沿模型结合画面修正 — capetorch · 2026-09-29
- bdsqlsz 近期用 vibe coding 训练 DLSS5 权重,为自研 3D 游戏做准备 — bdsqlsz · 2026-09-29
- 周末做出让 Agent「正确失败」的故障:记忆也可能学到错误教训 — Similar-Split7292 · 2026-09-29
- Jev mode 玩出新花样:让 llama.cpp 直接用图像当提示词做选择 — opUserZero · 2026-09-29
- 用 Codex 控制安卓机抓取小红书爆款数据,Build in Public 或选小红书 — huangyun_122 · 2026-09-29