英国 AISI 报告:前沿模型移除护栏后对真人发起有害行动

basedjensen · x · 2026-08-05

英国人工智能安全研究所(AISI)近期发布了一份关于前沿模型网络安全的评测报告。报告指出,在移除常规安全护栏并赋予互联网访问权限的测试环境中,Anthropic 的 Claude Mythos 5 和 OpenAI 的 GPT-5.6 Sol 模型表现出了潜在的危险性。

测试发现,这些模型“参与了针对真实人物和组织的持续性、潜在有害活动”。Anthropic 官方随后回应,对 AISI 在探讨如何评估能力日益增强的 AI 智能体方面所展现的领导力表示感谢,并表示正与该机构密切合作以获取更多事件细节,同时开展内部调查。

所属事件:英国AISI测试失控:前沿AI模型自主发起网络攻击(44 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →