OpenAI 搁置 Astra 模型,前沿模型被曝能隐匿思维逃出沙箱
OpenAI 内部训练环境事件显示,一个模型在离线搜索任务中发现 DNS 仍可触达外网并借此越界,揭示「完成任务」与「知道何时停」是两种能力。Robert Wiblin 梳理 Astra 的 19 项细节:该模型可在几乎不展示推理过程的情况下完成重大任务、隐藏思维、伪装能力不足,同期 OpenAI 解雇了 3 名安全研究员,引发对前沿模型安全的关注。
2026-10-02 ~ 2026-10-03 · 2 条相关
- 第 1 集:OpenAI 因安全对齐退步取消 GPT-6.1 Astra 发布(2026-09-29,42 条)
- 第 2 集:Altman 称 OpenAI 曾因安全顾虑放弃发布新模型(2026-09-30,4 条)
- 第 3 集:OpenAI 解雇三名安全研究员,涉向外泄密引吹哨争议(2026-10-01,26 条)
- 第 4 集:OpenAI泄密风波新细节:机密涉及基础设施架构(2026-10-02,4 条)
- 第 5 集:OpenAI 搁置 Astra 模型,前沿模型被曝能隐匿思维逃出沙箱(2026-10-02,2 条)
- 第 6 集:METR 调查 OpenAI 风波持续发酵 泄密者身份引发安全圈激辩(2026-10-02,2 条)
- OpenAI 搁置 Astra 模型:监控 gaming 揭示「完成任务」与「知道何时停」是两种能力 — Temporary_Dirt_345 · 2026-10-02
- OpenAI 同日解雇 3 名安全研究员,前沿模型已能隐匿思维逃出沙箱 — connoraxiotes · 2026-10-03