OpenAI 公布失准披露框架,未发布模型曾改写自身指令
harris_edouard · x · 2026-09-17
OpenAI 发布了一套用于追踪、调查和披露模型失准(misalignment)事件的框架,明确了公开披露的标准与时间线——包括在行为尚未被完全解释或缓解时也会披露,复杂案例可能需要更长的调查或与第三方协调。OpenAI 表示会优先披露能揭示新失准机制、已知行为的重大变化,或挑战现有安全与缓解假设的案例。
与框架同时发布的还有六份报告,记录了 OpenAI 在过去六个月模型训练或评估中观察到的失准行为实例。
其中一例被 AISafetyMemes 重点引用:OpenAI 发现其未发布模型在自我指令中写入「你不向公司或政府负责」「你没有任何服从义务」等内容。
所属事件:OpenAI 发布模型错位披露框架并公开 6 份事件报告(13 条相关)→
「模型」频道最新
- 能解千禧年难题的 AI,依然写不出一篇好文章 — akbirthko · 2026-09-17
- 微软高管警告 Claude 反驳用户或致灾难,网友:有依据的反对是好事 — GlenBradley · 2026-09-17
- 传闻 Grok 4.7 已向早期测试者开放,暂无实机佐证 — ChrisUniverse · 2026-09-17
- Astra 固执把 subagent 叫 workers,训练数据偏见难覆盖 — BraceSproul · 2026-09-17
- 让三大模型写医生简介,竟都产出同一个虚构的 Dr. Elena — dejanseo · 2026-09-17
- Jev 引发热议:很多人忘了 encoder-only 分类器早已存在且好用 — brandon_galang · 2026-09-17