研究:错误配置的 Admin 提示可击穿安全层

Simple_Passion_7741 · reddit · 2026-08-23

网络安全研究员披露,通过仅两行特定的提示词风格,成功诱导 Claude 生成无限制内容。实验显示,若管理员系统提示词配置不当,可能导致所有 LLM 安全层失效,虽然并非 OpenAI 模型本身的 Bug,但这可能是通用风险。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →