OpenAI 公布模型失准披露框架,同步发布六份失准行为报告

thedealdirector · x · 2026-09-18

OpenAI 官方宣布了一套用于追踪、调查和披露模型失准(misalignment)实例的新框架,并同步公开六份过去六个月内观察到的失准行为报告。

框架要点:

报告涵盖模型训练与评估阶段观察到的失准实例,是 OpenAI 少见地系统性公开内部安全调查流程与案例的举措。

所属事件:OpenAI 发布模型失准披露框架并公开 6 份案例报告(14 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →