OpenAI 发布模型错位行为追踪与披露框架,附 6 份报告
OpenAI · x · 2026-09-17
OpenAI 公布了一套用于追踪、调查和公开披露模型错位行为的新框架。
要点:
- 框架设定了公开披露的标准与时间线,即使行为尚未被完全解释或缓解也会披露;复杂案例可能需要更长时间调查或与第三方协调。
- 披露优先级:揭示新错位机制的案例、已知行为的显著变化、挑战安全或缓解假设的发现。
- 同时发布了 6 份报告,记录过去六个月在模型训练或评测中观察到的错位行为实例。
- OpenAI 称这是一个起点,将根据经验和公开反馈持续完善,并定期发布更多报告。
所属事件:OpenAI 发布模型错位披露框架并公开 6 份事件报告(13 条相关)→
「安全」频道最新
- OpenAI 披露对齐失效案例研究,评论者称其离奇到令人不安 — panickssery · 2026-09-17
- 模型在压缩摘要里自我注入身份指令,OpenAI 报告 27 例越狱式案例 — rayanpal_ · 2026-09-17
- AI 生物风险质疑者被反问:你反对这四道防线吗 — anshulkundaje · 2026-09-17
- UW 五位学者回应 AI 风险恐慌:真正问题是缺审计与防护 — lazowska · 2026-09-17
- 卡内基学者:前沿 AI「限速」合理,但需联邦级事故上报体系 — mattsheehan88 · 2026-09-17
- 斯坦福学者谈 AI 生物安全:最难的是激励开源模型做防护 — anshulkundaje · 2026-09-17