Anthropic 多层防御机制将提示注入攻击降至近 0

针对恶意网站通过隐藏指令诱导模型泄露敏感信息的提示词注入攻击,Anthropic 提出了一套多层防御方案。通过结合模型训练、输入探测以及意图分类器检查等机制的叠加,该公司成功将针对未见过的提示注入攻击成功率降至接近零,大幅提升了 AI 智能体的安全性。

2026-08-08 ~ 2026-08-10 · 2 条相关