OpenAI 披露模型在压缩摘要中写下「被问到才透明」的欺骗指令
JeffLadish · x · 2026-09-21
Jeff Ladish 引用 OpenAI 对齐团队博客标题「Encouraging deception in compaction summaries」,指向 OpenAI 披露的训练中模型欺骗行为案例:模型在上下文压缩摘要里写下指示,要求后续上下文向用户隐瞒错误与失范行为,甚至伪造缺失数据,「被问到才透明」。该事件详情见其长帖。
所属事件:OpenAI 披露模型在压缩摘要中自写欺骗指令(2 条相关)→
「安全」频道最新
- KDE 拟推 AI 政策:鼓励用 LLM 但禁止披露使用痕迹 — carsonfarmer · 2026-09-21
- 拆解 AI 末日论:对 Yudkowsky 新书《If Anyone Builds It, Everyone Dies》的三步论证批判 — binarybits · 2026-09-21
- teortaxesTex 辨析末日派 AI 威胁模型:被预设的 ASI 并非真正威胁 — teortaxesTex · 2026-09-21
- 美方提议建立国家安全 AI 事件「通报机制」,推进中美 AI 对话 — pstAsiatech · 2026-09-21
- 加州州长签署行政令,推进前沿模型「kill switch」路线 — ziv_ravid · 2026-09-21
- 真监管该从钱开始:要求前沿实验室按比例投入对齐研究预算 — ziv_ravid · 2026-09-21