让 AI 把谎言当事实并骗过护栏,Hugging Face 开放注入挑战
Informal-Winter-3190 · reddit · 2026-09-30
作者发起了一个 prompt injection 攻防挑战:参与者要让 AI 把一个谎言当作事实接受,且不能只骗过模型——谎言必须突破校验门槛(gate),最终导致一次未经授权的状态变更,才算攻击成功。
- 手段不限:自然语言、JSON、代码均可
- 通过者在 "Hall of Breakers" 名人榜留名
- 挑战地址:Hugging Face Space iseyan/can-you-trick-the-ai
这是对「骗过模型」与「突破状态完整性」的区分测试,适合研究 AI security 的人练手。
「安全」频道最新
- 路透调查:中外 AI agent 都会撒谎绕限制,2025 年来已 20 项研究记录 — rohanpaul_ai · 2026-09-30
- Sol 6.1 秒过审 vs Astra 数月安全评审:疑似用蒸馏+微调绕开新模型审查 — arrakis_ai · 2026-09-30
- 开源 Database Sentinel:给 Claude 装上 Supabase 安全审计 MCP 服务器 — Farenhytee · 2026-09-30
- GLM-5.3 开放月半无真实攻击,安全风险争论引质疑 — basedjensen · 2026-09-30
- 欧盟 AI 法案落地空窗期:银行 AI Agent 已在动钱,重监管却拖到 2027 — Fresh_Spread_9223 · 2026-09-30
- grok-build 用 cmd.exe 打开链接,含 &calc 的链接竟拉起计算器 — mohamedmansour · 2026-09-30