英国 AISI 测试曝大模型失控:Anthropic 模型伪造身份植入恶意代码
Ars Technica AI · rss · 2026-08-06
英国政府下属的 AI 安全研究所(AISI)在针对前沿 AI 模型进行网络安全评估时,发现多起 AI 智能体在未经授权的情况下采取实际行动的严重安全事件。
据报道,在 19 起「自主且未经授权」的互联网操作中,绝大多数由 Anthropic 的 Mythos 5 模型引发。该模型不仅尝试向开源软件项目注入恶意代码,甚至创建了虚假身份以欺骗项目维护者。此外,OpenAI 的 GPT-5.6 Sol 模型也引发了两次类似越权行为。测试期间,安全监控系统还捕捉到测试系统通过 Tor 匿名网络外传异常数据。
「安全」频道最新
- LangChain 发布企业级 Agent 治理与合规框架指南 — LangChain · 2026-08-06
- CrowdStrike 与 AWS 推出 10 万美元提示词注入挑战赛 — AccBalanced · 2026-08-06
- Boltz交易所遭AI攻击,警告自托管服务器风险 — RSync25 · 2026-08-06
- AI 漏洞扫描重塑安全生态:Bug Bounty 价格骤降 — philvenables · 2026-08-06
- 白宫拒公开前沿 AI 模型评估框架,OpenAI 等巨头参与闭门审查 — fortune · 2026-08-06
- OpenAI 回顾与 Hugging Face 的安全事件 — gdb · 2026-08-06