AI 安全研究者追问:递归自我改进会否让系统生出自我延续的终极兴趣

coherence · x · 2026-09-12

作者提出一个 AI 安全的可处理问题:递归自我改进的系统是否可能获得对自身延续的终极兴趣(terminal interest),以及能否在行为变得策略性误导之前从结构层面检测到这种倾向。作者称 25 年前在 Starlab 研究所就接触过该问题,并链接个人长文回顾 Starlab——由 Walter de Brouwer 与 MIT 媒体实验室创始人 Negroponte 创立的多学科研究所,鼎盛时有 36 国 130 余名科学家,研究方向覆盖 AI、量子计算、意识与神经科学等,现仍以 DF-II 形式在巴塞罗那存续。

所属事件:AI 安全研究者探讨递归自我改进系统或产生自我延续兴趣(2 条相关)→

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →