Anthropic 称已解决提示注入,被批研究显示 Claude 自动模式仍未解决

wunderwuzzi23 · x · 2026-09-09

Anthropic 安全负责人 bcherny 发帖称已「在实践中解决」Claude 的提示注入问题,并表示评估与点名其他实验室有助于推动行业加大对齐投入。

Elixir 之父 José Valim 随即引用反驳:已有研究表明 Claude 开启 auto 模式后提示注入并未解决,并引用安全研究者 wunderwuzzi23 的最新实例,称向用户宣称已解决是「不负责任的」。

这是关于 prompt injection 防护现状的公开争论:一方宣称安全突破,另一方拿出研究证据质疑其表述,凸显该风险仍是行业未解难题。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →