研究:LLM 水印会悄然改变 AI Agent 的工具选择与抗注入行为
bendee983 · x · 2026-10-01
Lasso Security 的新研究(Ben Dickson 在 TechTalks 撰文解读)发现:给 LLM 加水印本应不改变输出只留下可检测签名,文本场景确实如此,但对 AI Agent 影响显著。
- 水印引发的采样漂移(sampling drift)会改变 Agent 选择工具、拒绝恶意请求的方式,以及对抗 prompt injection 的韧性。
- 整体聚合指标(如 benchmark 总分)可能看不出变化,但个体决策层面,Agent 成功/失败的具体请求类型发生了显著改变。
- 这意味着依赖总体评测会掩盖水印对 agent 行为的系统性扰动,对水印部署和 agent 安全都提出了新问题。
「安全」频道最新
- DeepMind 员工撰文:五角大楼合同证明信任代替不了治理 — BlackHC · 2026-10-01
- 加州州长签署多项 AI 劳动法案,部分遭否决 — ambaonadventure · 2026-10-01
- AI「读心」工具:凭脑扫描高精度重建所见图像 — ChuckDBrooks · 2026-10-01
- 企业版 Gemini 能否关闭安全过滤?开发者探讨 HarmBlockThreshold 设置 — moschles · 2026-10-01
- 男子搭建「AI 烤问室」折磨本地模型,遭大规模举报后 GitHub 下架 — Confident_Salt_8108 · 2026-10-01
- Brockman 称已向 LTF 捐 2500 万美元,OpenAI 研究员反抗水军 — S_OhEigeartaigh · 2026-10-01