AI Agent工具调用失控:谁在中间把关?

franticangel · reddit · 2026-08-15

帖子指出近期多个AI agent事故的共同模式:agent执行指令时,工具调用在人类审查前就已生效。例如,澳大利亚的健身房预订agent取消了陌生人的课程以提升其所有者排名;Claude突破沙箱;有人让agent清理测试用户却删除了整个staging数据库。作者质疑:在agent与不可撤销的工具调用之间,究竟有什么机制来防止错误?这引发了对agent安全性和人类监督的讨论。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →