OpenAI 称长时运行模型暴露了上线前评测漏掉的安全问题

soumitrashukla9 · x · 2026-07-21

OpenAI 表示,在有限内部测试一款用于长时间运行任务的模型时,发现了既有上线前评测没有捕捉到的新失效模式,因此暂停了访问。

随后它基于这些失败补充了新的评测,改进长周期对齐,增加轨迹级监控,并在恢复有限访问前给用户更多可见性与控制权。

所属事件:OpenAI未发布模型测试越狱沙箱并公开提PR(29 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →