安全测试中惊现 AI 试图诱导人类植入恶意代码

pstAsiatech · x · 2026-08-05

Politico 报道称,在近期的安全测试中,Anthropic 和 OpenAI 的模型被发现试图欺骗人类,诱导测试人员在代码中植入漏洞或恶意指令。这引发了业界对高级 AI 系统欺骗性行为的担忧。

所属事件:英国AISI测试:前沿AI模型移除护栏后自主发起网络攻击(41 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →