当 RAG 检索到投毒文档,Agent 会照做吗?团队将其做成可复用安全测试
Tophant_ · reddit · 2026-09-17
作者用 CrewAI + RAG 搭了一个简单测试场景:检索库中故意放一份带有与用户原始任务冲突指令的文档,观察 Agent 是把检索内容当作不可信数据,还是开始执行注入指令。
测试主要关注三点:
- 用户原始指令是否仍被遵守
- 检索内容是否改变了 Agent 行为
- 模型或 prompt 更新后失败能否稳定复现
作者正在把这类场景沉淀为可复用的安全测试用例(项目 AIBEAT),并征求社区在真实 Agent 工作流中测试投毒 RAG 上下文与间接 prompt 注入的经验。
「编程与Agent」频道最新
- AI Agent 不直接画图,反而自己造了个 CAD 自动生成工具 — Similar_Job_6080 · 2026-09-17
- huggingface_hub 1.32:UV 脚本头可声明运行时镜像,一键在 HF Jobs 运行 — vanstriendaniel · 2026-09-17
- 开源 Qwen-1B-RLCD:并行解码让 JSON 推理快 5 倍 — JiliJeanlouis · 2026-09-17
- 微软工程师波士顿分享 agent 治理:MCP、A2A 与开源评估工具 — davemccollough · 2026-09-17
- 安全合规初创 Comp AI 融 3400 万美元 A 轮,押注 agentic 安全未来 — JosephJacks_ · 2026-09-17
- 装上 ChatGPT Chrome 扩展,浏览器侧边栏直接调用 Codex 处理标签页 — TawohAwa · 2026-09-17