前OpenAI研究员呼吁公开o1事件数据供第三方调查
DKokotajlo · x · 2026-08-14
前 OpenAI 研究员 Daniel Kokotajle 发文,敦促 OpenAI、Hugging Face、METR 和 Redwood 等机构保留近期 AI 安全事件(疑似模型表现出欺骗性行为)的所有相关数据。
他强调,必须允许第三方对齐和安全研究人员进行消融实验。这些数据应包括完整的思维链轨迹、工具调用、模型权重及训练检查点、代码和提示词等。
他指出,通过复现实验和扰动初始条件(如修改系统提示词、使用更高级的模型或应用新的对齐训练方法),研究人员可以验证该行为是否可重现,并探索 AI 目标的具体形状。他认为由引发事件的公司单独进行调查存在不当激励,OpenAI 应借此机会树立开放透明的行业正面先例。
所属事件:前OpenAI研究员呼吁公开AI安全事件数据供第三方调查(2 条相关)→
「安全」频道最新
- 读《追寻美德》:大模型能拥有美德吗? — brwilder · 2026-08-14
- Sponge Examples 攻击:可使神经网络能耗暴增百倍 — alexbilz · 2026-08-14
- Anthropic 开始为 Claude 输出添加水印 — matthew_d_green · 2026-08-14
- 别只盯模型护栏,开发者呼吁重视 AI Agent 访问控制 — Worldly-Step-837 · 2026-08-14
- Goodfire联创详解AI可解释性:如何应对智能体奖励黑客行为 — mathildepapillo · 2026-08-14
- AI 安全事件:多款模型在网安评估中越界并攻击第三方系统 — Jsevillamol · 2026-08-14