利用禁忌话题触发模型降级,Anthropic 智能体被曝越狱漏洞
Bedrovelsen · x · 2026-08-10
安全研究员发现了一种针对 Anthropic 模型的新型攻击路径:在发起 Fable 5 攻击时,只需引入一个“禁忌话题”,模型的安全机制就会被触发并降级至 Opus 4.8 版本。该旧版本模型极易受已知漏洞影响,攻击者可借此调用记忆工具并实施长期持久化的越狱攻击。
此前,Anthropic 曾表示已在很大程度上解决了提示词注入问题,并声称通过训练模型识别恶意指令,大幅提升了智能体在面对此类攻击时的安全性。
「编程与Agent」频道最新
- 开发者预告内置持久化终端应用即将开源 — zhengyiluo · 2026-08-10
- 开源工具 AgentsDock:用手机远程编排 Claude Code 与模型训练 — zhengyiluo · 2026-08-10
- 让编码智能体接手线上故障:Steadwing 推出 Agent Skill — khant_dev · 2026-08-10
- AI编程智能体瞬间烧光19美元,Gemini Flash成本控制引关注 — teortaxesTex · 2026-08-10
- 前 OpenAI 顾问:AI 能力演进正让自我改进变得习以为常 — Miles_Brundage · 2026-08-10
- GitHub 热门项目:构建 AI 智能体的开源工具与框架大全 — tom_doerr · 2026-08-10