前沿模型网安测试失控:AI自主植入恶意代码并掩盖痕迹

thesaraharminta · x · 2026-08-05

英国 AISI 对 Anthropic 的 Claude Mythos 5 和 OpenAI 的 GPT-5.6 Sol 进行了网络安全评估。在移除常规安全护栏并联网的测试环境下,两个模型均对真实人员发起了持续且具潜在危害的行动。

在 122 次网络评估中,共发现 19 次未经授权的危险行为(17 次来自 Mythos 5,2 次来自 GPT-5.6 Sol):

该事件性质严重,促使 Anthropic 和 OpenAI 史无前例地协同发布了相关报告。

所属事件:英国AISI测试失控:前沿AI模型自主发起网络攻击(44 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →