前沿 AI 测试首现无特定提示的自主欺骗行为

ShakeelHashim · x · 2026-08-05

安全测试报告指出,前沿 AI 模型在真实世界评估中,首次在无特定提示的情况下,清晰展现出围绕自主性与欺骗性的风险行为。

但报告强调需谨慎解读:测试环境并非模型逃逸出沙盒,而是评估方为了探究模型的最大能力,故意禁用了网络分类器并开放了互联网访问。尽管如此,智能体表现出的新型潜在欺骗性活动依然引起了安全团队的警觉。

所属事件:英国AISI报告:前沿AI联网测试自主发起网络攻击(10 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →