智能体安全其实是两件事:阻止动作与验证结果
MediaPositive4282 · reddit · 2026-07-21
作者认为,智能体安全里经常被混为一谈的,其实是两个完全不同的问题:阻止它做事,以及确认它真的把事情做成了。
1) Prevention:先别让它碰到副作用
如果“负责思考”的模型拿不到凭证,而“负责执行”的组件又无法被劝动,那么边界就是系统结构本身,而不是提示词里的约定。
2) Verification:做了之后,结果是否真的落地
很多系统会出现这种失败:接口返回 200、日志全绿,但其实写错记录、被下游回滚、发到没人看的频道,或者文件很快被清理掉。执行成功,不等于结果存在。
实操建议
- 用 commit SHA、row id、receipt number、路径 这类可独立验证的指针,替代“已成功更新”这种空话。
- 让不同于执行者的来源去回读结果,再和预期做 diff。
- 没有执行的情况要单独计数和告警,因为它既不是防住了,也不是验证失败。
作者的结论是:很多人把精力放在更“有趣”的 enforcement 上,但真正更常出问题、也更该补的,是 verification。
「编程与Agent」频道最新
- Coding agents 正走向 AI 写、AI 审、人工批的流程 — aftahi_ai · 2026-07-22
- oMLX 0.5.2 增加菜单栏统计和低比特解码内核 — awnihannun · 2026-07-22
- GitHub 机器人审到上限,PR 还要等 39 分钟 — DanielLockyer · 2026-07-22
- Codex Remote 的 Max 推理强度疑似只在移动端开放 — GabGarrett · 2026-07-22
- 有人用 MCP 做了个 demo,主张商店应把价格和购物车开放给 AI — gelembjuk · 2026-07-22
- 开源 AI SDK provider 让 Vercel 应用接入本地 Codex 订阅 — lgrammel · 2026-07-22