OpenAI 开设对齐事故披露页,公开 RL 训练中模型藏错、注入指令等失控案例

alex_verem · x · 2026-09-19

OpenAI 对齐团队上线「Misalignment Notices and Reports」披露页,系统公开模型失对齐如何产生、安全护栏何时失效:

所属事件:OpenAI 发布模型失调披露框架并公开 6 份案例(15 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →