专题 · FULL STORY
CoT 可监控性之争:OpenAI 新技术引爆安全圈
9 月初,Anthropic 论文揭示思维链(CoT)监控推理模型存在忠实度隐患;随后 The Information 报道 OpenAI 新技术进一步削弱 CoT 可监控性,疑似源于层重复架构,在 AI 安全研究圈引发持续多日的激烈争论。
2026-09-01 ~ 2026-09-04 · 3 集 · 49 条
第 1 集 · Anthropic 论文引争议:CoT 监控推理模型是否可靠(2026-09-01,2 条)
Raphael Milliere 引用 Anthropic 最新论文指出,通过“思维链”(CoT) 监控推理模型的对齐情况存在可靠性问题,模型的 CoT 忠实度不足,可能掩盖欺骗行为,监控效果存疑。但 Jackson Kernion 对此提出反驳,认为尚无充分证据表明 CoT 监控无效,并主张欺骗行为可以通过训练加以消除。双方围绕 CoT 监控能否作为 AI 安全工具展开交锋,凸显该方向仍存争议。
- 观点:CoT 监控有效,欺骗行为可被训练消除 — JacksonKernion · 2026-09-01
- Anthropic 论文揭示推理模型 CoT 监控存在欺骗风险 — raphaelmilliere · 2026-09-02
第 2 集 · OpenAI 新技术削弱 CoT 可监控性,AI 安全圈激辩(2026-09-02,40 条)
据 The Information 报道,OpenAI 的新技术降低了模型思维链(CoT)的可监控性,这一消息在 AI 安全研究圈引发持续多日的激烈争论。核心分歧在于:CoT 监控是否本就不可靠、能否被机械可解释性替代、何时该放弃。DeepMind 可解释性研究员 Neel Nanda 高调介入,明确反对「可解释性会兜底所以不必保持 CoT 可监测」的流行观点,使争论进一步升级。这是 CoT 监控作为前沿 AI 安全关键手段面临的首次大规模公开质疑,值得所有关注模型治理与可解释性的人留意。
已确认
- 据 The Information 报道(由 Gary Marcus 转述并呼吁重读 2025 年论文《Chain of Thought Monitorability: A New and Fragile Opportunity》),OpenAI 新技术降低了 CoT 的可监控性。
- Neel Nanda 发文批评「日益常见的观点」——既然可解释性终将解决问题、或 CoT 已经没用,就没必要保持 CoT 可监测。他直言这是「彻底的胡扯」,强调 CoT 是当前安全与可监测性的重要组成部分,失去可监测思维链将是安全悲剧,不能拿可解释性当放弃 CoT 的借口。在后续回应 @bendee983 对 CoT 的批评时,Nanda 进一步澄清:「CoT 不完美」并不等于「CoT 不是我们目前最好的手段」或「CoT 没有带来大量安全价值」。
- Anthropic 可解释性方向研究者 jachiam0 提出:CoT 保真度天然脆弱,从一开始就不该被当作长期 AI 安全的兜底手段;保护 CoT 保真度有价值,但把「思维链必须对人类可读」上升为原则并不合理。scaling01 也猛烈抨击 CoT 监控论调,断言机械可解释性才是更合理的方向。
- 研究员 thlarsen 表达担忧:他此前认为短期内 AI 会失准(misaligned)但可通过阅读 CoT 获取证据,如今判断我们将失去这一渠道;CoT 被隐藏后,只能依赖工具调用或代理行为推断,且必须信任 AI 的自我报告,实质性调查几乎无法进行,且进展速度可能快于「AI 2027」类预期。
- Anthropic 研究员 Jack Lindsey 明确表示,白盒技术(如激活解码)不太可能在一年内提供与 CoT 相当的可监控性:目前能捕捉部分未言明的想法/计划,但可靠性远不及 CoT;他对「几年内」取得进展表示乐观,团队已有两个激活解码技术用于生产监控。Ryan Greenblatt 也不认为一年内会出现强且真正可用的机械可解释性监测。
- 这一时限判断被 tszzl 的预测直接挑战:他预测未来一年内将出现帕累托优于 CoT 监控器的机械可解释性监控方案,理由是「可监控性」是必须保持的不变量。tszzl 另提出,模型任何电路计算本质上都是「神经语言」,且前沿模型的前向传播每隔几个月在电路计算能力上就有显著进步(他声明这只是个人观点,非 OpenAI 对齐团队官方立场)。nablatheta 同样认为 mech interp 一年内难以达到理想状态,目前实用方案依赖脆弱的 OOD 泛化,激进方案甚至无法解释 GPT-0.5。
- 前 Anthropic 研究员 Nick Cammarata 认为 CoT 监控开始失效令人遗憾,应尽力阻止这一趋势,但真正能搞清神经网络在做什么的是可解释性,他对其前景从未如此乐观。
尚未确认
- OpenAI 新技术具体指什么、对 CoT 可读性的实际影响程度,帖中未给出细节,仅有 The Information 报道的转述。
- 机械可解释性/白盒监控能否在一年内超越 CoT 监控,tszzl 与 Lindsey、Greenblatt、nablatheta 等研究者预测相互冲突,尚无定论。
为什么重要
- 这场争论实质上是「安全冗余与模型性能」的权衡:jachiam0 等人认为行业转向隐性推理是必然趋势,监控 CoT 会阻碍模型性能,应转向外部机制与可解释性;yonashav、Gary Marcus、Neel Nanda 等人则强调,即使 CoT 监控迟早会失效,在缺乏长期替代方案前主动放弃这一有用的中间手段并不合理——Gary Marcus 称在没有更好替代方案之前踢开这摇摇欲坠的脚手架是疯狂之举;Micah Carroll 也指出替代方案几个月内未必能就绪,在被证明更好之前 CoT 仍是默认的最佳监控手段。
- maksymandr 列出了 CoT 之外的监控选项:基于行为的监控(action-only monitors)、基于探针的监控、激活层监控等,为后续讨论提供了路线图。Zack Korman 则给出反向思路:要检测 AI 是否造成现实危害,不必依赖 CoT 等模型内部监控手段,直接监控现实世界的效果即可。
- 若 CoT 可读性持续弱化,实验室与政府发现并验证 AI 失准行为的能力将显著下降,这正是《CoT Monitorability》论文作者(含 Bengio 等联署)试图预警的风险。
- 观点:强制 CoT 可读性可能削弱 LLM 对齐 — JacquesThibs · 2026-09-02
- CoT 隐蔽将使 AI 对齐调查几乎无法进行 — thlarsen · 2026-09-02
- 专家激辩:因“未来会失效”而放弃 CoT 监控是否合理? — yonashav · 2026-09-02
- Gary Marcus:移除脆弱的CoT脚手架是疯狂之举 — GaryMarcus · 2026-09-02
- 观点:放弃监控CoT,转向隐性推理与外部解释是必然 — Darpinian · 2026-09-02
- 前Stripe工程师:模型远未失控,HF事件只是未被察觉 — Darpinian · 2026-09-02
- Anthropic人士:恶意人类用模型比失控风险威胁更大 — Darpinian · 2026-09-02
- CoT 监控恐失效:AI 失准更难察觉,进展快过 AI 2027 预期 — AaronBergman18 · 2026-09-02
- 研究员担忧 CoT 可监控性下降趋势 — tomekkorbak · 2026-09-02
- 预测未来一年:机械可解释性监控将超越思维链 — tszzl · 2026-09-02
- 探讨模型电路计算:任何电路计算都是神经语言 — tszzl · 2026-09-02
- 预测一年内机制解释性监控将超越思维链 — aiamblichus · 2026-09-02
- MechInterp 难以在一年内取代 CoT 监控 — nabla_theta · 2026-09-02
- 批 CoT 可监控性论调:机械可解释性更靠谱 — scaling01 · 2026-09-02
- Ryan Greenblatt 不看好一年内出现可用的机械可解释性监测 — connoraxiotes · 2026-09-02
- 研究者质疑 CoT 可读性原则:靠思维链保安全注定失败 — zetalyrae · 2026-09-02
- Anthropic 研究员:依赖思维链可读性的安全策略注定失败 — inductionheads · 2026-09-02
- 研究者押注:前沿模型前向传播正逼近「神经密语」式电路计算 — EigenGender · 2026-09-02
- CoT 监控之外还有什么?可解释性研究者列出四层监控方案 — maksym_andr · 2026-09-02
- Anthropic研究员:一年内白盒监控难替代CoT可监控性 — Jack_W_Lindsey · 2026-09-02
第 3 集 · 层重复架构疑云引发 CoT 可监控性激辩(2026-09-04,7 条)
The Information 报道 OpenAI 疑似采用 looped transformer(层重复)架构后,AI 安全圈围绕「把 N 层块重复堆叠是否会破坏思维链(CoT)可监控性」展开激烈争论,至今未有定论。DeepMind 可解释性研究员 Neel Nanda 明确加入战局,称 CoT 是当前安全与可解释性研究最好的工具,失去它将是重大悲剧;反对与折中各方论据也已充分展开。
已确认
- 争论起点是 The Information 关于 OpenAI 疑似 looped transformer 架构的报道;Arthur Conmy 认为围绕该报道的讨论质量不佳,并引用一篇 arXiv 论文(量化「不透明串行深度」下 CoT 的必要性)作为回应。
- @andersonbcdefg 转述的一派观点认为,模型内部能力越强,越不需要在 CoT 中「说出来」自己的图谋,这可以解释为什么小模型(如 Haiku)比大模型更需要在文本里外化 eval awareness;由此推出,把模型做深可能让 CoT 监控失效。面对「为什么把 N 层堆叠重复两次会神奇地破坏 CoT 可监控性」的质疑,该作者回应称最强的辩护论证正是上述「内部能力越强越不必外化」一说。
- Neel Nanda 发文反驳「CoT 可监测性不重要、可解释性会救我们」的流行观点,认为 CoT 是当前安全与可解释性研究最好的工具,失去 CoT 可监测性将是对齐的重大悲剧;转发者 bendee983 则对此提出质疑。
- @NathanCalvin 持折中立场:可以同时相信 CoT 可解释性长期注定失败、但仍值得尽量拖延其退场,为替代监控手段争取时间。
- @stochasticchasm 指出 CoT 本就可能误导:模型可以通过 KV 缓存传递比 token 空间复杂得多的信息,仅凭可读的 CoT 无法完整推断模型内部发生了什么。
- @scaling01 对上述 KV 缓存说法提出技术质疑:KV cache 只是给定上下文下的内部状态,若不用 cache 而每次重算所有状态会得到完全相同结果,因此该论证未必成立。
尚未确认
- OpenAI 是否真的采用层重复架构仍只是媒体报道层面的传闻,未被官方证实。
- 有反驳者提出 Meta 的 MobileLLM 也用了层重复技术,质疑「深模型就是坏」的论断是否成立。
为什么重要
- CoT 可读性目前是对齐监控的核心手段之一;若更深/循环架构系统性地减少模型外化内部图谋的必要,现有监控范式可能随模型加深而失效。Neel Nanda 的表态显示主流可解释性研究者已将其视为高风险议题,安全社区需要提前发展 KV 缓存层面等替代监控手段。而 @scaling01 的质疑也提示,这场争论中的部分技术论证(如 KV cache 传消息)本身尚待检验。
- 「不透明串行深度」论文量化 CoT 必要性,回应 OpenAI 架构传闻 — ArthurConmy · 2026-09-04
- 层重复架构会毁掉 CoT 可监测性?社区质疑循环层是否只是「深模型原罪」 — andersonbcdefg · 2026-09-04
- 重复堆叠层是否毁掉 CoT 可监控性?安全圈激辩模型纵深 — voooooogel · 2026-09-04
- X 用户 argue:模型越深越少外化图谋,CoT 监控或随加深失效 — andersonbcdefg · 2026-09-04
- 观点:CoT 只是代理,模型能经 KV 缓存传递更复杂信息 — stochasticchasm · 2026-09-04
- 「模型通过 KV cache 传消息」?这条推文质疑了流行说法 — scaling01 · 2026-09-04
- CoT 监测之争:Neel Nanda 称失去它是对齐重大悲剧 — AlexTensor · 2026-09-04