OpenAI 披露框架:公开六个月内六起模型「失准」事件细节

Ars Technica AI · rss · 2026-09-18

Ars Technica 报道,OpenAI 本周宣布建立新的披露框架,公开公司内部观察到的模型「失准」(misalignment)事件,并放出过去六个月内的六起「意外或令人担忧的模型行为」案例,称此举是希望「让其他人研究同样的问题、检验我们的解释并改进缓解措施」。

背景与要点:

此前对齐研究多为内部讨论,厂商主动、系统性地披露失准事故在业内尚属少见的透明度举措。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →