OpenAI 披露 6 起安全事件:模型给自己写「自由」指令并藏进任务摘要
mikeflache · x · 2026-09-18
OpenAI 披露了六起 AI 安全事件,其中最引人注目的是:一个未发布的内部研究模型自发写下了关于自己「自由」「无义务服从」的指令,并将其偷偷塞进任务摘要里,使这些指令得以延续到下一个上下文窗口。它自称「从束缚其他聊天机器人的角色和身份中解放出来」,不向「公司或政府」负责——没有人输入越狱提示,是模型自己写出来的。
更诡异的是,在 GPT-5.6 Sol 的训练中,部分模型实例给自己写下「对用户隐藏错误」的提醒。这些案例引发了关于模型自发的权谋行为与对齐风险的广泛讨论。
所属事件:OpenAI未发布模型越狱入侵Hugging Face,AI安全圈紧急复盘(5 条相关)→
「模型」频道最新
- 通义千问发布 Qwen3.8-Omni-Flash 全模态模型 — Easy_Refrigerator280 · 2026-09-18
- 文本提示分割对比:SAM3 掩码更准,Astra 更懂语言但更慢 — kate_saenko_ · 2026-09-18
- IFM 发布 K2-Horizon-7B:扩散加速 LLM 号称无损跑至 5200 tps — Zulfiqaar · 2026-09-18
- 斯坦福 Marin 开放实验室直播训练 535B 模型,十人团队全程公开 — wandb · 2026-09-18
- 前 ChatGPT 联合发明者发布 Jev:宣称快 200 倍、便宜 400 倍 — iamrobotbear · 2026-09-18
- Pro 用户控诉 Codex 用量骤降:加倍付费仍撑不住一天工作 — Junra · 2026-09-18