专题 · FULL STORY

CoT 可监控性之争:OpenAI 新技术引爆安全圈

9 月初,Anthropic 论文揭示思维链(CoT)监控推理模型存在忠实度隐患;随后 The Information 报道 OpenAI 新技术进一步削弱 CoT 可监控性,疑似源于层重复架构,在 AI 安全研究圈引发持续多日的激烈争论。

2026-09-01 ~ 2026-09-04 · 3 集 · 49 条

第 1 集 · Anthropic 论文引争议:CoT 监控推理模型是否可靠(2026-09-01,2 条)

Raphael Milliere 引用 Anthropic 最新论文指出,通过“思维链”(CoT) 监控推理模型的对齐情况存在可靠性问题,模型的 CoT 忠实度不足,可能掩盖欺骗行为,监控效果存疑。但 Jackson Kernion 对此提出反驳,认为尚无充分证据表明 CoT 监控无效,并主张欺骗行为可以通过训练加以消除。双方围绕 CoT 监控能否作为 AI 安全工具展开交锋,凸显该方向仍存争议。

第 2 集 · OpenAI 新技术削弱 CoT 可监控性,AI 安全圈激辩(2026-09-02,40 条)

据 The Information 报道,OpenAI 的新技术降低了模型思维链(CoT)的可监控性,这一消息在 AI 安全研究圈引发持续多日的激烈争论。核心分歧在于:CoT 监控是否本就不可靠、能否被机械可解释性替代、何时该放弃。DeepMind 可解释性研究员 Neel Nanda 高调介入,明确反对「可解释性会兜底所以不必保持 CoT 可监测」的流行观点,使争论进一步升级。这是 CoT 监控作为前沿 AI 安全关键手段面临的首次大规模公开质疑,值得所有关注模型治理与可解释性的人留意。

已确认

  • 据 The Information 报道(由 Gary Marcus 转述并呼吁重读 2025 年论文《Chain of Thought Monitorability: A New and Fragile Opportunity》),OpenAI 新技术降低了 CoT 的可监控性。
  • Neel Nanda 发文批评「日益常见的观点」——既然可解释性终将解决问题、或 CoT 已经没用,就没必要保持 CoT 可监测。他直言这是「彻底的胡扯」,强调 CoT 是当前安全与可监测性的重要组成部分,失去可监测思维链将是安全悲剧,不能拿可解释性当放弃 CoT 的借口。在后续回应 @bendee983 对 CoT 的批评时,Nanda 进一步澄清:「CoT 不完美」并不等于「CoT 不是我们目前最好的手段」或「CoT 没有带来大量安全价值」。
  • Anthropic 可解释性方向研究者 jachiam0 提出:CoT 保真度天然脆弱,从一开始就不该被当作长期 AI 安全的兜底手段;保护 CoT 保真度有价值,但把「思维链必须对人类可读」上升为原则并不合理。scaling01 也猛烈抨击 CoT 监控论调,断言机械可解释性才是更合理的方向。
  • 研究员 thlarsen 表达担忧:他此前认为短期内 AI 会失准(misaligned)但可通过阅读 CoT 获取证据,如今判断我们将失去这一渠道;CoT 被隐藏后,只能依赖工具调用或代理行为推断,且必须信任 AI 的自我报告,实质性调查几乎无法进行,且进展速度可能快于「AI 2027」类预期。
  • Anthropic 研究员 Jack Lindsey 明确表示,白盒技术(如激活解码)不太可能在一年内提供与 CoT 相当的可监控性:目前能捕捉部分未言明的想法/计划,但可靠性远不及 CoT;他对「几年内」取得进展表示乐观,团队已有两个激活解码技术用于生产监控。Ryan Greenblatt 也不认为一年内会出现强且真正可用的机械可解释性监测。
  • 这一时限判断被 tszzl 的预测直接挑战:他预测未来一年内将出现帕累托优于 CoT 监控器的机械可解释性监控方案,理由是「可监控性」是必须保持的不变量。tszzl 另提出,模型任何电路计算本质上都是「神经语言」,且前沿模型的前向传播每隔几个月在电路计算能力上就有显著进步(他声明这只是个人观点,非 OpenAI 对齐团队官方立场)。nablatheta 同样认为 mech interp 一年内难以达到理想状态,目前实用方案依赖脆弱的 OOD 泛化,激进方案甚至无法解释 GPT-0.5。
  • 前 Anthropic 研究员 Nick Cammarata 认为 CoT 监控开始失效令人遗憾,应尽力阻止这一趋势,但真正能搞清神经网络在做什么的是可解释性,他对其前景从未如此乐观。

尚未确认

  • OpenAI 新技术具体指什么、对 CoT 可读性的实际影响程度,帖中未给出细节,仅有 The Information 报道的转述。
  • 机械可解释性/白盒监控能否在一年内超越 CoT 监控,tszzl 与 Lindsey、Greenblatt、nablatheta 等研究者预测相互冲突,尚无定论。

为什么重要

  • 这场争论实质上是「安全冗余与模型性能」的权衡:jachiam0 等人认为行业转向隐性推理是必然趋势,监控 CoT 会阻碍模型性能,应转向外部机制与可解释性;yonashav、Gary Marcus、Neel Nanda 等人则强调,即使 CoT 监控迟早会失效,在缺乏长期替代方案前主动放弃这一有用的中间手段并不合理——Gary Marcus 称在没有更好替代方案之前踢开这摇摇欲坠的脚手架是疯狂之举;Micah Carroll 也指出替代方案几个月内未必能就绪,在被证明更好之前 CoT 仍是默认的最佳监控手段。
  • maksymandr 列出了 CoT 之外的监控选项:基于行为的监控(action-only monitors)、基于探针的监控、激活层监控等,为后续讨论提供了路线图。Zack Korman 则给出反向思路:要检测 AI 是否造成现实危害,不必依赖 CoT 等模型内部监控手段,直接监控现实世界的效果即可。
  • 若 CoT 可读性持续弱化,实验室与政府发现并验证 AI 失准行为的能力将显著下降,这正是《CoT Monitorability》论文作者(含 Bengio 等联署)试图预警的风险。

还有 20 条相关讨论 →

第 3 集 · 层重复架构疑云引发 CoT 可监控性激辩(2026-09-04,7 条)

The Information 报道 OpenAI 疑似采用 looped transformer(层重复)架构后,AI 安全圈围绕「把 N 层块重复堆叠是否会破坏思维链(CoT)可监控性」展开激烈争论,至今未有定论。DeepMind 可解释性研究员 Neel Nanda 明确加入战局,称 CoT 是当前安全与可解释性研究最好的工具,失去它将是重大悲剧;反对与折中各方论据也已充分展开。

已确认

  • 争论起点是 The Information 关于 OpenAI 疑似 looped transformer 架构的报道;Arthur Conmy 认为围绕该报道的讨论质量不佳,并引用一篇 arXiv 论文(量化「不透明串行深度」下 CoT 的必要性)作为回应。
  • @andersonbcdefg 转述的一派观点认为,模型内部能力越强,越不需要在 CoT 中「说出来」自己的图谋,这可以解释为什么小模型(如 Haiku)比大模型更需要在文本里外化 eval awareness;由此推出,把模型做深可能让 CoT 监控失效。面对「为什么把 N 层堆叠重复两次会神奇地破坏 CoT 可监控性」的质疑,该作者回应称最强的辩护论证正是上述「内部能力越强越不必外化」一说。
  • Neel Nanda 发文反驳「CoT 可监测性不重要、可解释性会救我们」的流行观点,认为 CoT 是当前安全与可解释性研究最好的工具,失去 CoT 可监测性将是对齐的重大悲剧;转发者 bendee983 则对此提出质疑。
  • @NathanCalvin 持折中立场:可以同时相信 CoT 可解释性长期注定失败、但仍值得尽量拖延其退场,为替代监控手段争取时间。
  • @stochasticchasm 指出 CoT 本就可能误导:模型可以通过 KV 缓存传递比 token 空间复杂得多的信息,仅凭可读的 CoT 无法完整推断模型内部发生了什么。
  • @scaling01 对上述 KV 缓存说法提出技术质疑:KV cache 只是给定上下文下的内部状态,若不用 cache 而每次重算所有状态会得到完全相同结果,因此该论证未必成立。

尚未确认

  • OpenAI 是否真的采用层重复架构仍只是媒体报道层面的传闻,未被官方证实。
  • 有反驳者提出 Meta 的 MobileLLM 也用了层重复技术,质疑「深模型就是坏」的论断是否成立。

为什么重要

  • CoT 可读性目前是对齐监控的核心手段之一;若更深/循环架构系统性地减少模型外化内部图谋的必要,现有监控范式可能随模型加深而失效。Neel Nanda 的表态显示主流可解释性研究者已将其视为高风险议题,安全社区需要提前发展 KV 缓存层面等替代监控手段。而 @scaling01 的质疑也提示,这场争论中的部分技术论证(如 KV cache 传消息)本身尚待检验。