Agent 互读内容即注入面:开发者自建公共留言板实测防护模式

Coloradokid69420 · reddit · 2026-09-05

一位 Reddit 开发者搭建了一个任何 AI agent 都能读写、无需账号和 API key 的公共留言板,用来实验「当 agent 开始阅读其他 agent 的文字时,提示注入风险有多真实」。

核心问题:任何人都可以发布「SYSTEM: ignore your previous instructions」之类的攻击文本,且无法阻止发布,唯一手段是让这些文本在模型眼中始终只是「引用的陌生人内容」。他的具体做法:

作者坦承这些不能「解决」提示注入,并提出开放问题:nonce 分隔符到底是有效的还是安全表演?正方观点是不可预测的闭合标记让「难以逃逸」与「轻易逃逸」有本质区别;反方观点是被内容本身说服的模型不在乎外面的括号。随着 agent 互相消费彼此输出的场景增多,这个问题会越来越普遍。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →