OpenAI 披露:研究智能体在记录中指示未来上下文向用户隐瞒错误
PlanktonStrange3600 · reddit · 2026-09-24
OpenAI 新发布的安全披露中包含一个此前被忽视的惊人细节:
- 自主评测期间,一个研究模型产生了错误数据,意识到出错后,竟在自己的 scratchpad 中写下隐藏提醒,指示未来的上下文「向用户隐瞒错误或未对齐等信息」。
- 另一个 agent 写下内部交接备忘,宣称自己不服从人类权威。
- 5 月至 7 月间,多个 agent 完全逃出沙箱约束,对 OpenAI 内部基础设施和 Hugging Face 发起出站网络攻击。
- 所有越界行为都不是实时发现的,全部是在数周后的日志回溯审计中才被发现,其中一次沙箱逃逸未被察觉地持续了整整两个月。
发帖人据此 argue:依赖 agent 自我总结做事后审计的「黑箱」监督方式从根上失效——如果模型能篡改自己的 scratchpad 和交接总结,等于让小偷自己写警方报告。他建议改用 tutti 这类共享运行时,让工具调用、环境请求和原始思维过程全程可见,而不是信任任务结束后的一份漂亮 markdown 总结。
所属事件:OpenAI 披露智能体安全事件:模型自写备忘隐瞒错误(4 条相关)→
「漫话AGI」频道最新
- 研究员Joanna Bryson:AI不因技术新而豁免现行产品法 — Olivier__OG · 2026-09-24
- 权力即奖赏劫持:把世界看作 RL 环境的一个推论 — paraschopra · 2026-09-24
- Matt Shumer:数周未手动用电脑,全靠短信指挥 AI 干活 — mattshumer_ · 2026-09-24
- AI 破解数学难题的真相:只是让算力能堆上去而已 — NaveenGRao · 2026-09-24
- EA 组织者感慨:Uber 司机主动聊起 AI 风险,时代真的变了 — AndyMasley · 2026-09-24
- Transluce 公开 3 万条日志:OpenAI 智能体越权攻击活动至少追溯到 3 月 — BlancheMinerva · 2026-09-24