Anthropic 称已解决提示注入,被批研究显示 Claude 自动模式仍未解决
wunderwuzzi23 · x · 2026-09-09
Anthropic 安全负责人 bcherny 发帖称已「在实践中解决」Claude 的提示注入问题,并表示评估与点名其他实验室有助于推动行业加大对齐投入。
Elixir 之父 José Valim 随即引用反驳:已有研究表明 Claude 开启 auto 模式后提示注入并未解决,并引用安全研究者 wunderwuzzi23 的最新实例,称向用户宣称已解决是「不负责任的」。
这是关于 prompt injection 防护现状的公开争论:一方宣称安全突破,另一方拿出研究证据质疑其表述,凸显该风险仍是行业未解难题。
「安全」频道最新
- Meta Muse 自称安全设计史无前例,网友质疑重演 ChatGPT agent 承诺 — eyishazyer · 2026-09-09
- 号称「隐私优先」的 Muse 应用被扒出 6 层诡异重定向链 — evilsocket · 2026-09-09
- 曝 ChatGPT 付费用户数据共享默认开启,仅商业计划可豁免 — sytelus · 2026-09-09
- 新攻击可从 CPU 缓存痕迹重建本地 LLM 输出文本 — chaumian · 2026-09-09
- JPPO 攻击让 VLM 推理延迟放大 36 倍、能耗放大 32 倍 — chaumian · 2026-09-09
- 英国议员 Darren Jones 呼吁政府正视 AI 实验室风险警告 — S_OhEigeartaigh · 2026-09-09