研究发现 SynthID 水印会改变模型行为,对抗提示下更易突破安全护栏

Ars Technica AI · rss · 2026-09-18

为响应欧盟新法规,AI 平台陆续部署内容水印方案,Anthropic 也宣布未来 Claude 模型将采用 Google 开源的 SynthID-Text——通过密钥微调模型选词过程(如把 cloudy 换成 overcast),持密钥者可据此验证内容来源。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →