OpenAI 首次系统披露六起模型失调事件并建立公开披露机制

9 月 16 日,OpenAI 首次系统性披露了过去六个月观察到的六起模型失调(misalignment)事件,同时发布新的问题披露框架,并上线集中收录失对齐案例的披露页「Misalignment Notices and Reports」。官方承诺今后观察到失调行为后将更快公开报告,即使尚未完全解释或缓解,并明确承认「对齐问题尚未解决」。这是头部 AI 公司首次系统性公开此类案例,被视为安全透明度上的重要动作。

已确认

为什么重要

2026-09-17 ~ 2026-09-17 · 6 条相关

一手来源