OpenAI 发布模型失准披露框架,并公开六份失准行为报告

rickasaurus · x · 2026-09-17

OpenAI 官方发布一套新框架,用于追踪、调查和披露模型失准(model misalignment)实例。框架设定了公开披露的标准与时间线,包括尚未完全解释或缓解的行为也将披露;复杂案例可能需要更长调查或与第三方协调,披露优先级给到揭示新失准机制、已知行为显著变化、或挑战安全假设的案例。同时公布了六份报告,记录近六个月在训练或评估中观察到的失准行为。有用户转推并称其中案例是「漂亮的 specification gaming」。

所属事件:OpenAI 发布错位行为披露框架并公开 6 份报告(48 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →