OpenAI 发布失对齐披露框架并公布 6 起事件

OpenAI 于 9 月 17 日发布一套用于追踪、调查和公开披露模型错位(misalignment)行为的新框架,并同期公布首批 6 份错位事件报告,覆盖过去一年发现的多个此前未披露案例。当前结论是:OpenAI 已将错位事件的外部披露制度化,即使行为尚未被完全解释或修复也会公开,这被广泛视为对齐研究透明度的一次实质性提升,值得关注。

已确认

为什么重要

2026-09-17 ~ 2026-09-17 · 13 条相关

一手来源

另有 2 条近重复转述:wiredmagazine · deanwball