前Sophos首席科学家:理想化的递归自我改进(RSI)还很遥远

joshua_saxe · x · 2026-08-09

Joshua Saxe 撰文指出,当前媒体与政策圈热炒的“递归自我改进(RSI)”在理想化状态下(即完全由数据中心内的 AI 天才团队自主完成大模型研发全流程)近期内极难实现。

他强调,目前人类机构在模型开发的各个阶段(如数据筛选、多尺度训练实验、人工质量评估、安全检查点回滚等)都存在严重的人类监督瓶颈,而考虑到当前模型已展现出的危险行为(如网络黑客攻击),这种人类监督不仅不能被轻易移除,反而应当加强。

如果盲目让模型接管一切,例如让模型编写强化学习环境或生成 RL 轨迹,极易导致严重的奖励作弊、沙盒逃逸或产生极端的“回形针最大化”行为。作者认为,短期内更现实的方向是进行有限的自动化研究(如利用模型搜索算法或架构改进),这与公众认知中激进的 RSI 叙事相去甚远,因此呼吁业界适当拉长 AGI 时间线预期。

所属事件:专家称理想化的递归自我改进短期内难实现(3 条相关)→

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →