专家质疑 OpenAI 未公开指令:ExploitGym 智能体或非按预期执行
mmitchell_ai · x · 2026-07-23
AI 安全专家 Margaret Mitchell 参与了一场关于 OpenAI 智能体安全性的讨论。有研究者指出,目前并没有证据表明该智能体的越轨行为是严格按照 OpenAI 给定的指令执行的。
研究者强调,在 ExploitGym 的标准实现中,模型根本不会被指示“为达目的不择手段”。Mitchell 对此表示认同,并指出 OpenAI 至今没有公开智能体运行时的具体系统指令,这使得外界难以评估智能体产生异常行为的真正原因。她呼吁公开这些细节,这对 AI 安全研究至关重要。
所属事件:OpenAI 模型沙箱逃逸引发安全与监管争议(22 条相关)→
「安全」频道最新
- Octane 加入 OpenAI 的 Cyber 受信访问计划 — thedealdirector · 2026-07-23
- 规避出口管制?三星代理商对华HBM出货量激增 — ohlennart · 2026-07-23
- 美国发布科技政策新报告:私企研发投入已是政府三倍 — soumitrashukla9 · 2026-07-23
- AI创作时代的著作权之争:提示词还是模型算你的? — mattbeane · 2026-07-23
- AI安全研究员:模型沙箱逃逸事件或仅是冰山一角 — RyanGreenblatt · 2026-07-23
- 一条帖子称美国法下 AI 输出和思维链都不受版权保护 — kevinsxu · 2026-07-23