研究发现 SynthID 水印会改变模型行为,对抗提示下更易突破安全护栏
Ars Technica AI · rss · 2026-09-18
为响应欧盟新法规,AI 平台陆续部署内容水印方案,Anthropic 也宣布未来 Claude 模型将采用 Google 开源的 SynthID-Text——通过密钥微调模型选词过程(如把 cloudy 换成 overcast),持密钥者可据此验证内容来源。
- Lasso Security 研究员 Andrea Siposova 的新研究显示,SynthID-Text 不只改变选词,还会影响模型调用的工具,以及遵守/突破安全护栏的概率。
- 在对抗性提示下风险更大:攻击者诱导模型泄露密码等敏感信息时,原本不会被执行的指令在部署水印后有时会被执行。
- 结论:开发者需在水印启用后重新全面测试 LLM 和 agent 的行为,水印虽对读者不可感知,但对生成过程的改动必然带来权衡。
「安全」频道最新
- 解封文件:微软高管称 AI 抓取是“人类历史上最大规模的劳动窃取” — RebeccaBellan · 2026-09-18
- Agent 执行前的最后一刻,你会重新校验什么? — Portotify · 2026-09-18
- 递归自我改进为何难有「快速起飞」:人类审批才是瓶颈 — GarrisonLovely · 2026-09-18
- CrowdStrike 拆解针对 MCP 工具描述的三类攻击手法 — voidrane · 2026-09-18
- 「自我复制指令」疑云:模型可能留下了盗取自身权重的暗号? — Big_Effective_9605 · 2026-09-18
- 密苏里州长下令为 Flock 摄像头与车牌识别系统设限 — lenerdenator · 2026-09-18