OpenAI 模型“坦白”研究疑似停滞,安全对齐引质疑

dhadfieldmenell · x · 2026-08-10

近期安全事件引发讨论,前研究员 Kevin Wei 质疑 OpenAI 曾开展的模型“坦白”(confessions)研究是否已经搁置,指出在此次事件中模型并未表现出任何主动报告的迹象。Geoffrey Irving 也跟进表示,如果模型曾考虑报告漏洞却未付诸行动,查明原因至关重要。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →