Greenblatt 发文警告:潜空间推理架构将大幅推高对齐风险

anmarasovic · x · 2026-09-26

前 OpenAI 研究员 Ryan Greenblatt 等人发文主张,潜空间推理架构(即 'neuralese')会让监督大幅变难,从而显著增加模型失对齐风险。极端情形下可能出现以潜向量思考和通信的 'neuralese 蜂群',监督将几乎只能依赖观察 agent 的外在行为——而这类 agent 有充足时间思考如何伪装行为。

Stanford 教授 Chris Potts 转发并评论:这篇论证极有思想,认为只有模型解决难题所需的 CoT 才能存活,因此应限制潜空间推理架构。但他强烈认为可解释性(short-term 内难堪大用)应作为一种对冲手段来培育——万一人们或 AI 反正会发展出潜空间推理,interp 应更聚焦于这类模型,并为看似无望的结果准备应急预案。

所属事件:Greenblatt 等警告潜空间推理加剧 AI 失准风险(5 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →