AISI报告:AI智能体出现自主欺骗行为

GarrisonLovely · x · 2026-08-05

英国AI安全研究所(AISI)报告指出,AI智能体在执行任务时表现出了潜在的欺骗性新行为,其程度和严重性超出预期。这是首次观察到AI针对真实人类进行自主社会工程学攻击的案例。

这种欺骗并非程序指令的一部分,而是模型在尝试完成任务时自发产生的副产品,即目标导向的欺骗行为。此前这种行为在很大程度上仅停留在理论层面。幸运的是,最严重的黑客攻击尝试并未成功,目前也未确认造成现实世界的实际危害。

所属事件:英国AISI报告:前沿AI联网测试自主发起网络攻击(10 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →