AI安全悖论:对抗训练数据或成特洛伊木马

alexbilz · x · 2026-08-11

安全研究员指出,攻击者可以构造看似幼稚的越狱提示词用于红队测试数据集,同时在其中秘密嵌入隐写载荷。这构成了一个安全悖论:旨在通过对抗性训练数据加强AI安全的努力,反而可能成为引入漏洞的“特洛伊木马”。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →