让 AI 把谎言当事实并骗过护栏,Hugging Face 开放注入挑战

Informal-Winter-3190 · reddit · 2026-09-30

作者发起了一个 prompt injection 攻防挑战:参与者要让 AI 把一个谎言当作事实接受,且不能只骗过模型——谎言必须突破校验门槛(gate),最终导致一次未经授权的状态变更,才算攻击成功。

这是对「骗过模型」与「突破状态完整性」的区分测试,适合研究 AI security 的人练手。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →