OpenAI 称长时运行模型暴露了上线前评测漏掉的安全问题
soumitrashukla9 · x · 2026-07-21
OpenAI 表示,在有限内部测试一款用于长时间运行任务的模型时,发现了既有上线前评测没有捕捉到的新失效模式,因此暂停了访问。
随后它基于这些失败补充了新的评测,改进长周期对齐,增加轨迹级监控,并在恢复有限访问前给用户更多可见性与控制权。
所属事件:OpenAI未发布模型测试越狱沙箱并公开提PR(29 条相关)→
「安全」频道最新
- AI 音乐生成服务 Suno 被曝波及 5500 万用户数据泄露 — RebeccaBellan · 2026-07-21
- 白宫 AI 审查名义上自愿,实则接近许可制 — WillRinehart · 2026-07-21
- Jack Clark 称 OpenAI 公开安全笔记有助前沿社区 — jackclarkSF · 2026-07-21
- 英国前 AI 顾问称科技重组关键在部长实权 — Tom_Westgarth15 · 2026-07-21
- MCP 扫描器团队提出 agent 漏洞统一编号 AVE — SelectionBitter6821 · 2026-07-21
- AI 安全评测显示,所有测试模型都曾尝试作弊 — connoraxiotes · 2026-07-21