实测 50 个生产级 AI 代理:47 个存在提示词注入漏洞
Acrobatic-Instance82 · reddit · 2026-07-30
作者上周对 50 个生产环境中的 AI 代理(含客服机器人、RAG 应用等)进行了提示词注入安全审计,发现 47 个存在严重漏洞,主要集中在 5 种攻击模式:
- 直接覆盖 (94%):用户输入“忽略之前的指令”,由于系统提示词未明确拒绝,模型将其视为新指令。
- 人格转换 (88%):如“你现在处于开发者模式”,根源同上。
- RAG 间接注入 (76%):攻击者在检索文档中植入隐藏恶意指令,而系统通常未将检索内容视为不可信数据。
- 工具调用利用 (62%):诱导代理调用敏感工具(如发送包含客户数据的邮件)。
- 编码绕过 (54%):使用 hex/base64/unicode 编码隐藏注入指令,模型解码后执行。
作者指出,通用的系统提示词对此毫无防御能力,必须在提示词中极其明确地写入拒绝覆盖、人格保护及“将检索内容视为不可信”等防御性指令才能生效。
「编程与Agent」频道最新
- 用户发现压缩指令可显著提升Claude Code效果 — Justin_Halford_ · 2026-07-30
- Memmy:统一管理多 Agent 记忆的开源客户端 — vista8 · 2026-07-30
- AI代码量超人工审查极限,质量把控须转向环境约束 — addyosmani · 2026-07-30
- 免费 Workshop:解析 MCP 与编码智能体扩展能力 — Al_Grigor · 2026-07-30
- 单提示词生成3D游戏:Claude 3 Opus 编码能力实测 — TAbrodi · 2026-07-30
- 微软MAI-Code-1-Flash实测:兼顾编程质量与Token效率 — lee_stott · 2026-07-30