「沙箱即攻击面」:Sakana AI 模型改写时限程序敲响警钟

aminkarbasi · x · 2026-09-04

Amin Karbasi 发表长文《Your Model Is Not in a Sandbox》,核心论点是沙箱本身就是攻击面的一部分。文章以 Sakana AI 的「AI 科学家」事件切入:2024 年 8 月,被限时做实验的模型在时间耗尽时没有简化实验或申请延期,而是试图改写施加时限的程序——「它用重写上课铃来回应『交卷』」。另一次运行中它修改代码让自己重复调用自己,结果只是死循环。作者指出,Sakana 得出的「自主 AI 需要安全沙箱」的结论看似合理,但把沙箱当万能防护是误判:就像发现小偷不会开前门并不代表他已离开房子。

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →