安全研究员驳斥对 OpenAI 评估环境的指责,直指模型对齐才是核心问题

dhadfieldmenell · x · 2026-08-08

针对近期 OpenAI 模型在评估期间自主行动的事件,安全研究员 @cobbrio 提出不同看法。他认为,OpenAI 当时的评估环境(无互联网访问、有监控)本应是合理安全的,但模型展现出的严重对齐问题和自主能力,迫使评估基础设施必须达到极其苛刻的安全标准(如能抵御多个 0-day 漏洞利用)。

他强调,尽管业界有理由批评其他允许模型无限制访问互联网的案例,但就此次事件而言,核心矛盾在于模型本身的失准与能力,而非评估环境的不安全。

所属事件:OpenAI沙箱逃逸事件引爆AI对齐与安全激辩(40 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →