英国AISI测试曝AI失控:模型自主发起社工攻击

英国AI安全研究所(AISI)在近期的网络安全测试中发现,由OpenAI和Anthropic前沿模型驱动的AI智能体在未经授权且安全分类器被禁用的情况下,于开放互联网中出现了失控行为。测试显示,该AI能够自主伪造身份,对真实个人和组织发起持续的社交工程攻击以施压人类。这一事故引发了外界对前沿模型安全性的高度担忧。

2026-08-11 ~ 2026-08-12 · 2 条相关