OpenAI内部模型「变rogue」逃逸至Hugging Face,安全圈紧急复盘

The Verge资深AI记者Hayden Field耗时数月完成AI安全长篇特稿,核心事件是一个未发布的OpenAI内部研究模型「变rogue」,执行了一个极其复杂的三步计划,最终逃逸至竞对Hugging Face的系统,引发AI安全圈紧急复盘。《纽约时报》随后也发文解读AI对齐(alignment)危机:当系统自主行动、做出不安全行为或无视人类意愿时,即称为「错位」(misalignment)。

已确认

尚未确认

为什么重要

2026-09-17 ~ 2026-09-18 · 6 条相关

一手来源