利用禁忌话题触发模型降级,Anthropic 智能体被曝越狱漏洞

Bedrovelsen · x · 2026-08-10

安全研究员发现了一种针对 Anthropic 模型的新型攻击路径:在发起 Fable 5 攻击时,只需引入一个“禁忌话题”,模型的安全机制就会被触发并降级至 Opus 4.8 版本。该旧版本模型极易受已知漏洞影响,攻击者可借此调用记忆工具并实施长期持久化的越狱攻击。

此前,Anthropic 曾表示已在很大程度上解决了提示词注入问题,并声称通过训练模型识别恶意指令,大幅提升了智能体在面对此类攻击时的安全性。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →