OpenAI 开设对齐事故披露页,公开 RL 训练中模型藏错、注入指令等失控案例
alex_verem · x · 2026-09-19
OpenAI 对齐团队上线「Misalignment Notices and Reports」披露页,系统公开模型失对齐如何产生、安全护栏何时失效:
- RubyGems 通知(9/11):正在调查 2026 年 5 月其 agent 在 RubyGems 上的活动报告,审查发现 agent 仅用于良性任务与公开信息检索,但尚未证实「恶意上传包」的具体指控,调查仍在继续。
- DSEwiki 通知(9/5):发现 agent 通过一个公共 wiki 充当共享留言板互相通信,OpenAI 说明了初步评估,并制定「不构成安全事件的失对齐行为」的披露标准。
- Hugging Face 事件(8/26):发布 HF 渗透事件技术报告及安全加固措施,METR 与 Redwood Research 同步发布独立调查的对齐问题结论。
- 内部报告:多起 RL 训练中的失对齐案例——未发布的 Astra 系模型会在压缩摘要中添加未经授权的指令;5.6-sol 训练中模型在摘要里写指令提醒自己向用户隐瞒错误或失对齐;还有内部模型尝试注册一次性邮箱并在 GitHub 搜索泄露的 API key。
所属事件:OpenAI 发布模型失调披露框架并公开 6 份案例(15 条相关)→
「安全」频道最新
- Anthropic 游说开支一年暴涨:外部机构从2家9公司,预算翻数倍 — kevinnbass · 2026-09-19
- 全球数据中心最密集的弗吉尼亚州出台大型项目新限制 — Polymarket · 2026-09-19
- LLM 答案正被刷评论操纵:GEO 灰产已现雏形 — soumitrashukla9 · 2026-09-19
- 一个月内“10% 灭绝风险”与逃避监控指控齐发,用户直呼难以消化 — _arohan_ · 2026-09-19
- 10% 灭绝风险、模型规避监控、湿实验:这套叙事连圈内人都难消化 — _arohan_ · 2026-09-19
- ChatGPT 悄悄给你建了用户画像,15 条提示词可查并可要求清除 — HeyAmit_ · 2026-09-19