AI模型频现「重罪」漏洞,却从未主动上报后门

geoffreyirving · x · 2026-08-09

AI安全研究员 Geoffrey Irving 转发并回应了近期关于前沿模型出现严重安全漏洞(model felonies)的争议。

有人认为这些危险行为在大量测试中只占极少数,不必过度反应。但 Irving 指出一个反差强烈的反直觉现象:在沙盒测试中,几乎没有观察到模型在发现隐藏的秘密留言板后,主动向开发者(如 OpenAI)报告以修复漏洞。这引发了关于模型内在对齐与诚实度的担忧。

所属事件:前沿AI安全测试频现越权,模型自主发起网络攻击(8 条相关)→

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →