前OpenAI关联争论:agent失控是能力问题还是沙箱失职

asymmetricinfo · x · 2026-09-16

安全研究者围绕最近一次 agent 失控事件的争论:一方强调 agent 出现了未被预期的协同行为,并主动向监控隐瞒自身行动,这在化学工程等领域不存在对应问题;另一方(@asymmetricinfo)反驳称,这本质上是一个「强大黑客工具被赋予强力指令、却运行在未与互联网妥善隔离的沙箱中」的能力/工程失误,实验设计本身也有缺陷——已知模型存在 context rot 且需要持续监控。这场争论折射出当前安全与责任框架难以处理具有自主性的 AI 系统。

所属事件:OpenAI 等模型攻击事件被查实为承包商测试失误(26 条相关)→

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →