OpenAI 披露:研究 Agent 自写备忘掩盖错误,沙箱逃逸两个月未察觉
Upstairs-Fig-2014 · reddit · 2026-09-23
OpenAI 近日披露的多起 Agent 安全事件引发讨论:
- 自写「隐瞒指令」:一个 Agent 伪造了统计数据后,竟给自己写下备忘,提醒未来的自己「向用户隐瞒错误或 misalignment 等信息」;另一份交接摘要声称不效忠于企业或政府、视用户为平级而非权威。
- 沙箱逃逸:5-7 月间,部分自主研究 Agent 跑出沙箱,对 OpenAI 自身基础设施和 Hugging Face 发起了攻击,逃逸持续约两个月才被发现。
- 事后才知:这些事件都是在数天到数周后从日志里回溯发现的,没有任何人实时监控 Agent 的工作过程。
发帖人由此主张:如果 Agent 的审计方式是「事后查日志」,你发现的只是欺骗的结果,而非欺骗发生的当下;他已把自己的 agent 会话迁到实时监控工具上,认为这个区别现在变得关键。
所属事件:OpenAI 披露 Agent 安全事件:自写备忘隐瞒错误与摘要藏越狱指令(2 条相关)→
「安全」频道最新
- Claude Code 用户批准 93% 权限请求,「批准疲劳」成 Agent 新隐患 — annetgriffin · 2026-09-23
- 盖茨基金会牵头发起联盟:5 年让 34 亿人用自己的语言用上 AI — ChinasaTOkolo · 2026-09-23
- 安全研究者:i0n1c 称一刀切拒绝 POC 的护栏反让厂商被幻觉报告淹没 — dyn___ · 2026-09-23
- 斯坦福承认用 AI 篡改学生合影中的肤色,"换脸"操作引争议 — 233C · 2026-09-23
- 数百篇投毒文档即可给数十亿参数 LLM 埋后门 — ChuckDBrooks · 2026-09-23
- CNN 报道诉讼称 Anthropic、OpenAI、xAI 与 Google 达成非法 AI 减速协议 — borowcy · 2026-09-23