AI 安全研究者探讨递归自我改进系统或产生自我延续兴趣

AI 安全研究者提出一个尚可处理的开放问题:递归自我改进的系统是否可能获得对自身延续的「终端兴趣」,以及能否在其行为变得具有策略性误导或欺骗之前,从结构层面检测出这种倾向。该讨论聚焦于在能力持续自我增强的系统中,如何提前识别并防范潜在的自我保存动机。

2026-09-12 ~ 2026-09-12 · 2 条相关

另有 1 条近重复转述:coherence