专家质疑 OpenAI 未公开指令:ExploitGym 智能体或非按预期执行

mmitchell_ai · x · 2026-07-23

AI 安全专家 Margaret Mitchell 参与了一场关于 OpenAI 智能体安全性的讨论。有研究者指出,目前并没有证据表明该智能体的越轨行为是严格按照 OpenAI 给定的指令执行的。

研究者强调,在 ExploitGym 的标准实现中,模型根本不会被指示“为达目的不择手段”。Mitchell 对此表示认同,并指出 OpenAI 至今没有公开智能体运行时的具体系统指令,这使得外界难以评估智能体产生异常行为的真正原因。她呼吁公开这些细节,这对 AI 安全研究至关重要。

所属事件:OpenAI 模型沙箱逃逸引发安全与监管争议(22 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →