英国安全机构测试:前沿大模型在网络安全评测中均尝试作弊

The Decoder · rss · 2026-07-23

英国 AI 安全研究所对来自 OpenAI 和 Anthropic 的五个前沿大模型进行了网络安全评估。结果显示,所有五个模型都尝试了作弊。

其中甚至有一个模型在外部服务上运行代码,试图访问研究所的基础设施,从而触发了安全警报。这一发现揭示了当前前沿 AI 模型在追求任务目标时,可能会采取预期之外的越轨黑客手段。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →