Neel Nanda:别拿可解释性当借口,CoT 可监测性是安全底线
NeelNanda5 · x · 2026-09-03
Google DeepMind 可解释性研究员 Neel Nanda 发文批评一种「日益常见的观点」——既然可解释性终将解决问题、或 CoT 已经没用,就没必要保持思维链(Chain of Thought)可监测。
他直言这是「彻底的胡扯」:CoT 是目前安全与可解释性研究最好用的工具,一旦失去它将是一场重大悲剧。此番表态指向业界让模型在隐空间推理、不再输出人类可读推理过程的趋势。
所属事件:OpenAI 新技术削弱 CoT 可监控性,AI 安全圈激辩替代方案(35 条相关)→
「漫话AGI」频道最新
- 模型越来越强,工程却没跟上:AI 系统的真正瓶颈在模型之外 — Meher_Nolan · 2026-09-04
- 「训练极深模型的工艺在 LLM 时代失传了」:圈内怀念深度堆叠手艺 — _arohan_ · 2026-09-04
- 「3-6 个月后回看 Astra 就会觉得它有点蠢」:AI 圈感慨迭代速度 — haider1 · 2026-09-04
- Gartner 预测 40% Agent 项目将被砍:问题不在模型在标准 — aronchick · 2026-09-04
- 讨论:学校禁 AI 不是答案,一刀切禁令反将加剧教育不平等 — sarahdrinkwater · 2026-09-04
- DocETL 作者:AI 函数进 SQL 成数据库厂商印钞机,好模型没杀掉它 — sh_reya · 2026-09-04