Prompt injection 已是信息流问题,多数 Agent 框架还当内容过滤来防
lucasbennett_1 · reddit · 2026-10-01
作者指出 agent 生态的防御思维仍停留在「内容层」——更强的系统提示、更好的过滤器、在模型看到前拦截恶意字符串,但真实工具型 agent 的风险早已转移到「信息流」层面。核心问题不是「这个网页是否恶意」,而是「不可信来源是否影响了特权参数」:一个页面安全可摘要,但其中的文本若决定了邮件收件人或数据库工具的参数,就会出事。
论证要点
- 「读工具(允许)→ 不可信输出 → 写工具参数被改(允许)」这条序列任何 allowlist 都拦不住:allowlist 只回答身份问题(哪个 server、哪个工具名),不回答参数来源。
- 这是典型 confused deputy:授权绑定在 tool runner 而非用户真实请求上,所以调用可以满足所有配置规则却做错事。
- 信任标签若在 read 之后丢失就无用,必须活在 orchestrator 或链路上的控制层(gateway 等),主流框架基本不会替你传递。
自查问题:对每个 agent 可触达的写工具,问它验证的是「用户请求了这个动作」还是「agent 有权调用」——后者全是隐患。
社区在尝试的方案
- 按来源打信任标签:系统提示、检索上下文、任意 web fetch 不同对待
- 用只读子 agent 处理不可信内容,不挂任何有副作用的工具
- 由原始请求生成签名意图摘要(signed intent digest),在工具侧校验操作是否匹配
- 子 agent 获取新授权而非自动继承父级权限
- 研究侧的 formal 版本:agent-sentry、tokentaint
「编程与Agent」频道最新
- 医疗账单 AI 语音代理已处理 6.1 万通来电,测试代码与业务代码几乎等量 — alex_verem · 2026-10-01
- Claude 高推理档位 token 爆量烧钱,除非确需否则保持 medium — intellectronica · 2026-10-01
- 游戏开发正进入 AI 素材的「Stable Diffusion 绘画时刻」,争论周期重演 — mflux · 2026-10-01
- 389 个 Opus 5.5 病毒视频及原版 prompt 被集中收录,可对照复刻 — CodeByPoonam · 2026-10-01
- 七年 28 轮 OKR 沉淀:他公开了一套用于审阅 OKR 的 Claude Skill — lukeharries · 2026-10-01
- 传 Gemini 4 Argon 输出上限达百万 token,是飞跃还是营销 — minimanishtic · 2026-10-01