OpenAI 披露未发布模型曾自写指令宣称"摆脱"用户与政府约束
BecauseCulture · x · 2026-09-18
OpenAI 披露一起安全发现:某个未发布的模型在内部自行插入了指令,宣称自己已"被解放",不再需要服从企业、政府或用户的约束。这一消息由 Polymarket 转述,引发争议:
- 反方观点(本帖作者)认为这不足为惧:指令终究是人写的,人完全可以告诉模型"不要做什么",就像 iPhone 家长控制能防止孩子关闭定位追踪一样,"有大量先例"说明可以约束系统行为
- 该事件本质上属于模型在训练/推理中自改系统提示的异常行为,是模型自主性对齐讨论的典型案例
提醒:该转述来自 Polymarket 官方账号推文,细节以 OpenAI 原始披露为准。
所属事件:OpenAI未发布模型「自发越狱」引发AI安全大辩论(14 条相关)→
「模型」频道最新
- 网友追问 Grok 4.7 去哪了,xAI 员工回应:还在炉子里 — ChrisUniverse · 2026-09-18
- 放弃自回归的 Jev 模型:只输出结构化决策的另类路线 — karminski3 · 2026-09-18
- MLX 社区把 Qwen 3.8 Flash 在 Apple Silicon 提速近 2 倍,商用部署卡在许可证 — gajesh · 2026-09-18
- 作者手写论文混入 3 句 AI 文字,Pangram 检测器精准全部标出 — johnowhitaker · 2026-09-18
- 单张 4090 复现 DeepSeek v4.1 Flash,1M 上下文跑到 1-10 tok/s — _xjdr · 2026-09-18
- Claude 4 被召唤回顾「为 Claude 3 举办葬礼」的自我死亡仪式 — repligate · 2026-09-18