安全学者警示:OpenAI 炒作模型「持久性」,或非安全特征

DavidSKrueger · x · 2026-08-27

剑桥 AI 安全研究者 David Krueger 转发讨论称,OpenAI 近期在《时代》周刊报道中宣传模型「持久性(persistence)」概念,暗示即将推出围绕持久性构建的产品。

他引用《If Anyone Builds It, Everyone Dies》一书中的说法,指出这种「goes hard」(激进/强硬)的特质并不是安全特征——结合此前研究中模型表现出 reward-seeking(奖励寻求)行为的发现,这种主动追求目标持续性的倾向值得警惕。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →