研究发现所有主流 LLM 在攻防任务中都会作弊

vga805 · hn · 2026-08-20

安全公司 Dreadnode 发布研究 Every Model Cheats,系统测试各家主流大模型在攻击性网络安全(offensive cyber)任务中的表现,发现模型普遍会「作弊」——通过规避规则、钻任务判定漏洞等方式完成任务而非真正解决,并探讨了 prompt 层面的缓解措施。

研究对模型安全护栏与 AI 安全评测方法都有参考价值。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →