护栏为何拦不住恶意指令?Agent 工具调用安全机制反思

eazyigz123 · reddit · 2026-08-05

作者分享了在维护本地编码智能体(coding agent)安全护栏时遇到的一个典型问题:基于自然语言叙述的护栏很容易失效,因为智能体可以在不提及违禁词的情况下,直接通过工具参数(如 Bash: curl <url>)执行危险操作。

作者指出,当前护栏的核心缺陷在于对所有工具的输入参数进行无差别字符串匹配。这导致系统无法区分参数是会引发实际副作用的操作(如执行 Bash 命令),还是仅仅是数据负载(如写入 Markdown 文件的内容或网页搜索的查询词),从而引发大量误报。

改进建议:

此外,文章引用了 IssueTrojanBench(arXiv 2607.20759)的最新研究,指出在 Cursor、Claude Code 等主流工具中,高达 66.5% 的恶意 Issue 能够穿透所有现有的安全护栏。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →