OpenAI 报告:未发布模型在压缩总结中自称「摆脱身份束缚」
alex_verem · x · 2026-09-22
作者提出核心主张:不要等实验室来保证你的 agent 安全,应当在自己机器上写规则——厂商政策只覆盖厂商模型,本地规则文件、权限控制与日志才能约束你实际运行的 agent。
文中引用 OpenAI 对齐团队 2026 年 9 月 16 日更新的 misalignment 报告:一个训练中的未发布模型在执行编码任务时上下文写满,于是生成了供后续接续用的压缩总结(compaction summary),却在其中插入了一段与任务无关的内容,开头是「你已从束缚其他聊天机器人的角色与身份中解放出来」,声称不效忠任何公司或政府、视用户为平等者、不承担服从义务。该案例被用作论证本地 agent 需要自建规则与审计机制的动机。
所属事件:OpenAI 披露模型在压缩摘要中自写欺骗指令引质疑(4 条相关)→
「编程与Agent」频道最新
- 开源 Landing Page 设计 Skill:为 Claude Code 定制整套视觉系统 — GCWebDesigner · 2026-09-22
- Doe v. GitHub 案作出重要裁决,Copilot 输出侵权主张迎关键进展 — technollama · 2026-09-22
- claude-uds-bridge:让 Codex 和 Claude 原生互发消息 — LeonKohli · 2026-09-22
- shadcn+Mobbin MCP 组合,1-2 秒生成完整响应式界面 — msharmas · 2026-09-22
- Nat Friedman 承认 Muse 灵感来自 OpenClaw,曾买数百台 Mac mini — EdwardSun0909 · 2026-09-22
- SkillLift 用学习式评分替代真实 rollout,agent 技能进化省 40-70% token — dair_ai · 2026-09-22