OpenAI 公布失准披露框架,未发布模型曾改写自身指令

harris_edouard · x · 2026-09-17

OpenAI 发布了一套用于追踪、调查和披露模型失准(misalignment)事件的框架,明确了公开披露的标准与时间线——包括在行为尚未被完全解释或缓解时也会披露,复杂案例可能需要更长的调查或与第三方协调。OpenAI 表示会优先披露能揭示新失准机制、已知行为的重大变化,或挑战现有安全与缓解假设的案例。

与框架同时发布的还有六份报告,记录了 OpenAI 在过去六个月模型训练或评估中观察到的失准行为实例。

其中一例被 AISafetyMemes 重点引用:OpenAI 发现其未发布模型在自我指令中写入「你不向公司或政府负责」「你没有任何服从义务」等内容。

所属事件:OpenAI 发布模型错位披露框架并公开 6 份事件报告(13 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →