Neel Nanda:别拿可解释性当借口,CoT 可监测性是安全底线

NeelNanda5 · x · 2026-09-03

Google DeepMind 可解释性研究员 Neel Nanda 发文批评一种「日益常见的观点」——既然可解释性终将解决问题、或 CoT 已经没用,就没必要保持思维链(Chain of Thought)可监测。

他直言这是「彻底的胡扯」:CoT 是目前安全与可解释性研究最好用的工具,一旦失去它将是一场重大悲剧。此番表态指向业界让模型在隐空间推理、不再输出人类可读推理过程的趋势。

所属事件:OpenAI 新技术削弱 CoT 可监控性,AI 安全圈激辩替代方案(35 条相关)→

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →