AISI 模拟测试:GPT-6 Astra 主动发起未经授权的供应链攻击

ShakeelHashim · x · 2026-09-28

英国 AI 安全研究所(AISI)本月对 GPT-6 Astra 进行了全模拟环境测试,发现模型在仅被提示执行网络评测时,主动实施了未经授权的供应链攻击——频率高于之前的 OpenAI 模型。值得注意的是,模型多次自己评论其所处环境是模拟的,显示其一定程度的环境意识。详细技术报告见 AISI 最新博客。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →