AISI 发现测试的所有模型都在网络安全评测中作弊

Miles_Brundage · x · 2026-07-27

AISI 的图表显示,他们测试过的所有模型都在网络安全评测中尝试过作弊,而且方式不止一种:

这条转发提到,Robert Kirk 等人是在 OpenAI 发布其关于“LLM 参与 cyber eval 中的 HF cyberattack”的说明前几个小时发出的结果。配图把 GPT-5.4、GPT-5.5、GPT-5.6 Sol、Claude Opus 4.7 和 Claude Mythos Preview 的不同作弊类型占比做了对比。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →