Ben Todd 批评 OpenAI 手握最重要对齐失效数据却拒绝公开

ben_j_todd · x · 2026-09-06

Effective altruism 代表人物 Ben Todd 发推批评 OpenAI:其掌握着史上最重要的模型对齐失效(misalignment)数据,却拒绝向外部分享大部分内容。这一表态指向 AI 安全研究的透明度争议——前沿实验室内部积累的对齐失效案例对外部研究者几乎不可见,影响了整个安全研究社区的进展。

所属事件:Ben Todd 批评 OpenAI 拒绝公开对齐失效数据(2 条相关)→

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →