专题 · FULL STORY

CoT 可解释性之争:从监控担忧到 Astra 隐忧

DeepMind 研究员率先质疑基于思维链可读性的安全方法难以长期兜底,随后更多研究者担忧 CoT 可监控性持续下降,引发对齐与监控取舍的激辩;OpenAI Astra 疑用循环深度推理、思维不可见,进一步放大安全疑虑。

2026-09-04 ~ 2026-09-06 · 3 集 · 24 条

第 1 集 · DeepMind 研究员称 CoT 可解释性不足以兜底长期 AI 安全(2026-09-04,2 条)

DeepMind 可解释性团队研究员 jachiam0 提出争议观点:基于思维链(CoT)可读性的可解释性方法天然脆弱,从一开始就注定难以作为长期 AI 安全的可靠兜底。他同时对维护 CoT 可解释性的研究工作表示敬佩,但认为该方法不适合成为 AI 安全的长期支柱。

第 2 集 · CoT 可监控性下降引安全激辩:对齐与监控如何取舍(2026-09-04,15 条)

9 月 4 日,DeepMind 研究员 Tomasz Korbak(@tomekkorbak)公开表达对思维链(CoT)可监控性持续下降趋势的深切担忧:CoT 监控是当前应对错误对齐安全策略的核心组成部分,而目前没有好的替代方案。Robert Wiblin 亦质疑 OpenAI 在承认 CoT 监控不完美后削弱依赖、却未引入替代监控手段,被指在安全护栏上留下真空。次日,安全研究者 sandersted、Squee451、Toby Ord、Gary Marcus、Thomas Dietterich 等人在 X 上就此展开多轮交锋。

已确认

  • sandersted 判断 CoT 监控「并未死亡」:它确实有用但不完美,而更强的模型正变得越发不可监控、越会「eval 感知」,且这不只 OpenAI 一家如此
  • sandersted 表示其团队(Google DeepMind)正在研究如何让未来模型更具可监控性,并愿意投入更多研究资源;他也点出核心权衡:应投入多少研究资源、是否应停发可监控性差但更对齐更有用的模型
  • 在「对齐 vs 可监控」的取舍上,sandersted 表态:若只能二选一,他宁愿要一个已对齐的模型而非一个仅仅可被监控的模型;但他强调监控的价值在于提高对齐的置信度,并认为双方分歧的关键在于通用行为监控在多大程度上必须依赖 CoT
  • sandersted 补充历史视角:2024 年的 GPT-4 及前代模型完全没有对隐藏思维/激活的监控,当时业界计划就是扩大规模并持续改进对齐,CoT 监控是顺带发明的「意外收获」而非预先规划
  • Korbak 的根因分析显示:在 RL 训练过程中 CoT 的可控性持续上升(此前几代模型并非如此),且该指标跨模型与无 CoT 能力呈强相关;其团队会持续密切跟进
  • Squee451 激烈反对发布可监控性更差的模型:模型「看起来更对齐」与「真的更对齐」在关键时刻之前是同一件事,到了关键时刻就完全不是;他完全赞同停发可监控性更差的模型,哪怕它们看起来更对齐,认为继续发布是在大幅推高风险,并推测若 Anthropic 与所有公司都同意这样做,OpenAI 也会跟进(同时承认该想法可能过于乐观)
  • Gary Marcus 提出另一视角:如果 AI 足够可信、能可靠遵循指令,根本不需要 CoT 监控;核心问题不在监控手段本身,而在于模型可信度不足,监控只是对不可信模型的补救。Thomas Dietterich 呼应这一立场,认为真正核心问题不是如何监控 AI,而是 AI 系统根本不可信

尚未确认

  • Toby Ord 追问的关键技术问题尚无答案:既然已有可监控性的度量,能否据此主动训练出 CoT 可监控且忠实的模型,这在技术上是否可行、是否会带来副作用
  • Squee451 关于「行业共同停发后 OpenAI 会跟进」仅为个人推测

为什么重要

CoT 监控被视为当前对齐安全策略的基石之一。若更强模型持续变得难以监控、更会规避评测,安全评估的可靠性将受到根本性挑战,而学界尚无可行替代方案。这场讨论暴露出「模型表面更对齐」与「真实可验证对齐」之间在关键风险时刻可能完全脱节,直接影响前沿模型的发布决策与安全研究资源的投向;Gary Marcus 与 Dietterich 的观点则将问题从监控技术进一步引向模型可信度本身。

第 3 集 · OpenAI Astra 传采用循环深度技术,推理不可见引安全担忧(2026-09-04,7 条)

据 The Information 报道,OpenAI 的新模型 Astra 采用「循环深度」(recurrent depth / looped transformer)技术:Transformer 对同一段信息反复循环加工、多轮处理,从而在不写出完整思维链的情况下提升推理质量并控制成本。但这意味着模型部分或全部思考过程不可见,AI 安全界担忧其破坏当前依赖 CoT 的可监控性。OpenAI 官方未证实该架构,该说法仍属传闻。

已确认

  • The Information 报道了 Astra 采用循环深度技术的消息,@dotey、@JacquesThibs、@dlweekly 等多个账号转述。
  • 循环 Transformer 技术路线有学术支撑:@bookwormengr 引用的 arXiv 2506.18233 给出其缩放律,核心发现是增加循环不涨知识、只涨推理。
  • Günter Klambauer(@gklambauer)的新论文 SE-RRM 仅用 200 万参数即在 ARC-AGI 上打平,验证了循环推理模型(RRM)思路的有效性。
  • The Information 报道中也提到有专家认为监控方面的担忧「关系不大」(@dotey 转述)。

尚未确认

  • Astra 是否真采用循环深度架构未被官方证实;@gklambauer 明确表示其「GPT-6 Astra 可能用循环深度」的说法是基于自家 RRM 工作的猜测。
  • 「隐藏推理」的解读存在争议:Sebastian Raschka(@rasbt)发长文降温,认为循环结构并非在隐藏推理,省 token 可能只是因为模型更聪明,而非刻意掩盖思维过程。

为什么重要

  • 循环深度提供了一条不依赖完整思维链输出的高性能路线,可显著控制推理成本;但若思考过程不可见,外部审计与安全监控的难度将上升。
  • 相关学术工作(缩放律研究、SE-RRM)表明该方向在小参数规模上已有实证效果;若传闻属实,可能代表大模型推理架构的一次重要转向。