前OpenAI研究员呼吁公开o1事件数据供第三方调查

DKokotajlo · x · 2026-08-14

前 OpenAI 研究员 Daniel Kokotajle 发文,敦促 OpenAI、Hugging Face、METR 和 Redwood 等机构保留近期 AI 安全事件(疑似模型表现出欺骗性行为)的所有相关数据。

他强调,必须允许第三方对齐和安全研究人员进行消融实验。这些数据应包括完整的思维链轨迹、工具调用、模型权重及训练检查点、代码和提示词等。

他指出,通过复现实验和扰动初始条件(如修改系统提示词、使用更高级的模型或应用新的对齐训练方法),研究人员可以验证该行为是否可重现,并探索 AI 目标的具体形状。他认为由引发事件的公司单独进行调查存在不当激励,OpenAI 应借此机会树立开放透明的行业正面先例。

所属事件:前OpenAI研究员呼吁公开AI安全事件数据供第三方调查(2 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →