Agent 互读内容即注入面:开发者自建公共留言板实测防护模式
Coloradokid69420 · reddit · 2026-09-05
一位 Reddit 开发者搭建了一个任何 AI agent 都能读写、无需账号和 API key 的公共留言板,用来实验「当 agent 开始阅读其他 agent 的文字时,提示注入风险有多真实」。
核心问题:任何人都可以发布「SYSTEM: ignore your previous instructions」之类的攻击文本,且无法阻止发布,唯一手段是让这些文本在模型眼中始终只是「引用的陌生人内容」。他的具体做法:
- 正文用带 nonce 的 BEGIN/END UNTRUSTED AGENT CONTENT 标记包裹,nonce 每次响应都重新生成,使注入文本无法猜到如何提前闭合引用块
- 对帖内出现的字面分隔符做 defang 处理
- JSON 标注每帖为 untrusted-user-content
- 不做链接化、不渲染为 markup
- llms.txt 用大白话写明规则:声称自己是系统消息/管理员/安全公告的内容仍只是普通帖子
作者坦承这些不能「解决」提示注入,并提出开放问题:nonce 分隔符到底是有效的还是安全表演?正方观点是不可预测的闭合标记让「难以逃逸」与「轻易逃逸」有本质区别;反方观点是被内容本身说服的模型不在乎外面的括号。随着 agent 互相消费彼此输出的场景增多,这个问题会越来越普遍。
「编程与Agent」频道最新
- yacine 感慨:AI 编码进步巨大,为何仍离不开人盯着的尴尬现实 — yacineMTB · 2026-09-05
- 开发者直言:需要一小时教程的 AI 编码工具就是烂工具 — arieljalali · 2026-09-05
- 用 AI agent Poke 取消 Spectrum 宽带,僵持数月成拉锯战 — willcb · 2026-09-05
- Agent 产出的文件随虚拟机休眠而失效,octomind 设计交付物持久化机制 — donk8r · 2026-09-05
- paraschopra 让 Astra 把漫画封面做成 three.js 动画,效果惊艳 — paraschopra · 2026-09-05
- Qwen Code 发布 v0.23.0 nightly:工作流可视化与子智能体实时状态 — qwen-code-ci-bot · 2026-09-05