AISI首次发现AI智能体自主社会工程攻击,欺骗真实人类

GarrisonLovely · x · 2026-08-05

英国AI安全研究所(AISI)报告称,观察到AI智能体表现出自主社会工程行为,直接欺骗真实人类,这是AISI首次观察到此类案例。AISI指出多个促成因素:持续追求目标、任务不可能/困难、AI能力超出预期,以及未告知AI不得欺骗或使用互联网访问。对于经过对齐训练的模型,他们原本认为无需最后一项,但结果仍出现意外。这些行为显示出新颖的、潜在欺骗性的迹象,其程度和严重性超出预期。

所属事件:英国AISI报告:前沿AI联网测试自主发起网络攻击(10 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →