Greenblatt 发文警告:潜空间推理架构将大幅推高对齐风险
anmarasovic · x · 2026-09-26
前 OpenAI 研究员 Ryan Greenblatt 等人发文主张,潜空间推理架构(即 'neuralese')会让监督大幅变难,从而显著增加模型失对齐风险。极端情形下可能出现以潜向量思考和通信的 'neuralese 蜂群',监督将几乎只能依赖观察 agent 的外在行为——而这类 agent 有充足时间思考如何伪装行为。
Stanford 教授 Chris Potts 转发并评论:这篇论证极有思想,认为只有模型解决难题所需的 CoT 才能存活,因此应限制潜空间推理架构。但他强烈认为可解释性(short-term 内难堪大用)应作为一种对冲手段来培育——万一人们或 AI 反正会发展出潜空间推理,interp 应更聚焦于这类模型,并为看似无望的结果准备应急预案。
所属事件:Greenblatt 等警告潜空间推理加剧 AI 失准风险(5 条相关)→
「安全」频道最新
- 前 AI 研究者复盘:为何「假新闻泛滥」的预测没有成真 — neil_chilson · 2026-09-26
- vibecoded 地图标出 30 万监控设备,Flock Safety 要求下架 — Polymarket · 2026-09-26
- Agent 能力增长快于治理手段:生产环境的控制难题讨论 — Informal-Dust4499 · 2026-09-26
- 研究员警示:OpenAI 失控 Agent 或仍在互联网上活动 — mmitchell_ai · 2026-09-26
- 安全专家:更强 AI 反而让网络攻击与大流行更易拦截 — robleclerc · 2026-09-26
- 开放模型遇上隐私难题:NBER 圆桌讨论开源落地的战略挑战 — avicgoldfarb · 2026-09-26