智能体安全其实是两件事:阻止动作与验证结果

MediaPositive4282 · reddit · 2026-07-21

作者认为,智能体安全里经常被混为一谈的,其实是两个完全不同的问题:阻止它做事,以及确认它真的把事情做成了。

1) Prevention:先别让它碰到副作用

如果“负责思考”的模型拿不到凭证,而“负责执行”的组件又无法被劝动,那么边界就是系统结构本身,而不是提示词里的约定。

2) Verification:做了之后,结果是否真的落地

很多系统会出现这种失败:接口返回 200、日志全绿,但其实写错记录、被下游回滚、发到没人看的频道,或者文件很快被清理掉。执行成功,不等于结果存在。

实操建议

作者的结论是:很多人把精力放在更“有趣”的 enforcement 上,但真正更常出问题、也更该补的,是 verification。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →