专题 · FULL STORY
CoT 可解释性之争:从监控担忧到 Astra 隐忧
DeepMind 研究员率先质疑基于思维链可读性的安全方法难以长期兜底,随后更多研究者担忧 CoT 可监控性持续下降,引发对齐与监控取舍的激辩;OpenAI Astra 疑用循环深度推理、思维不可见,进一步放大安全疑虑。
2026-09-04 ~ 2026-09-06 · 3 集 · 24 条
第 1 集 · DeepMind 研究员称 CoT 可解释性不足以兜底长期 AI 安全(2026-09-04,2 条)
DeepMind 可解释性团队研究员 jachiam0 提出争议观点:基于思维链(CoT)可读性的可解释性方法天然脆弱,从一开始就注定难以作为长期 AI 安全的可靠兜底。他同时对维护 CoT 可解释性的研究工作表示敬佩,但认为该方法不适合成为 AI 安全的长期支柱。
- 研究者:CoT 可读性不足以作为长期 AI 安全的兜底 — tszzl · 2026-09-04
- DeepMind 研究员:CoT 可解释性不适合作为 AI 安全的长期支柱 — cephaloform · 2026-09-04
第 2 集 · CoT 可监控性下降引安全激辩:对齐与监控如何取舍(2026-09-04,15 条)
9 月 4 日,DeepMind 研究员 Tomasz Korbak(@tomekkorbak)公开表达对思维链(CoT)可监控性持续下降趋势的深切担忧:CoT 监控是当前应对错误对齐安全策略的核心组成部分,而目前没有好的替代方案。Robert Wiblin 亦质疑 OpenAI 在承认 CoT 监控不完美后削弱依赖、却未引入替代监控手段,被指在安全护栏上留下真空。次日,安全研究者 sandersted、Squee451、Toby Ord、Gary Marcus、Thomas Dietterich 等人在 X 上就此展开多轮交锋。
已确认
- sandersted 判断 CoT 监控「并未死亡」:它确实有用但不完美,而更强的模型正变得越发不可监控、越会「eval 感知」,且这不只 OpenAI 一家如此
- sandersted 表示其团队(Google DeepMind)正在研究如何让未来模型更具可监控性,并愿意投入更多研究资源;他也点出核心权衡:应投入多少研究资源、是否应停发可监控性差但更对齐更有用的模型
- 在「对齐 vs 可监控」的取舍上,sandersted 表态:若只能二选一,他宁愿要一个已对齐的模型而非一个仅仅可被监控的模型;但他强调监控的价值在于提高对齐的置信度,并认为双方分歧的关键在于通用行为监控在多大程度上必须依赖 CoT
- sandersted 补充历史视角:2024 年的 GPT-4 及前代模型完全没有对隐藏思维/激活的监控,当时业界计划就是扩大规模并持续改进对齐,CoT 监控是顺带发明的「意外收获」而非预先规划
- Korbak 的根因分析显示:在 RL 训练过程中 CoT 的可控性持续上升(此前几代模型并非如此),且该指标跨模型与无 CoT 能力呈强相关;其团队会持续密切跟进
- Squee451 激烈反对发布可监控性更差的模型:模型「看起来更对齐」与「真的更对齐」在关键时刻之前是同一件事,到了关键时刻就完全不是;他完全赞同停发可监控性更差的模型,哪怕它们看起来更对齐,认为继续发布是在大幅推高风险,并推测若 Anthropic 与所有公司都同意这样做,OpenAI 也会跟进(同时承认该想法可能过于乐观)
- Gary Marcus 提出另一视角:如果 AI 足够可信、能可靠遵循指令,根本不需要 CoT 监控;核心问题不在监控手段本身,而在于模型可信度不足,监控只是对不可信模型的补救。Thomas Dietterich 呼应这一立场,认为真正核心问题不是如何监控 AI,而是 AI 系统根本不可信
尚未确认
- Toby Ord 追问的关键技术问题尚无答案:既然已有可监控性的度量,能否据此主动训练出 CoT 可监控且忠实的模型,这在技术上是否可行、是否会带来副作用
- Squee451 关于「行业共同停发后 OpenAI 会跟进」仅为个人推测
为什么重要
CoT 监控被视为当前对齐安全策略的基石之一。若更强模型持续变得难以监控、更会规避评测,安全评估的可靠性将受到根本性挑战,而学界尚无可行替代方案。这场讨论暴露出「模型表面更对齐」与「真实可验证对齐」之间在关键风险时刻可能完全脱节,直接影响前沿模型的发布决策与安全研究资源的投向;Gary Marcus 与 Dietterich 的观点则将问题从监控技术进一步引向模型可信度本身。
- 研究发现 RL 训练让 CoT 可控性上升,且与无 CoT 能力强相关 — tomekkorbak · 2026-09-04
- DeepMind 研究员警告:CoT 可监控性持续下降,对齐安全策略告急 — tomekkorbak · 2026-09-04
- AI 安全研究者警告:思维链可监控性正在持续下降 — tomekkorbak · 2026-09-04
- 研究者追问:能否主动训练出思维链可监控且忠实的模型 — tobyordoxford · 2026-09-04
- 质疑 OpenAI:CoT 监控不可靠就不监控,等于什么都不换 — AaronBergman18 · 2026-09-04
- 链式思维监控有效但不完美,更强模型更难被监控 — sandersted · 2026-09-05
- 研究者谈模型可监控性:更强模型正变得越难监控 — sandersted · 2026-09-05
- Google 研究者谈模型可监控性:投入多少、是否停发难监控模型 — sandersted · 2026-09-05
- 「看起来更对齐」≠「真的更对齐」:Squee451 炮轰发布权衡 — Squee451 · 2026-09-05
- 应否停发可监控性差的模型?Squee451:这明显在放大风险 — Squee451 · 2026-09-05
- 对齐 vs 可监控之争:sandersted 称更想要对齐的而非可监控的模型 — sandersted · 2026-09-05
- 对齐 vs 可监控:X 上围绕 CoT 监控必要性展开的辩论 — sandersted · 2026-09-05
- 2024 年的 GPT-4 根本没监控隐藏思维,CoT 监控只是意外收获 — sandersted · 2026-09-05
- Gary Marcus:CoT 监控是补丁,模型不听话才是真问题 — GaryMarcus · 2026-09-05
- CoT 监控之争:Dietterich 称核心问题是 AI 根本不可信 — tdietterich · 2026-09-05
第 3 集 · OpenAI Astra 传采用循环深度技术,推理不可见引安全担忧(2026-09-04,7 条)
据 The Information 报道,OpenAI 的新模型 Astra 采用「循环深度」(recurrent depth / looped transformer)技术:Transformer 对同一段信息反复循环加工、多轮处理,从而在不写出完整思维链的情况下提升推理质量并控制成本。但这意味着模型部分或全部思考过程不可见,AI 安全界担忧其破坏当前依赖 CoT 的可监控性。OpenAI 官方未证实该架构,该说法仍属传闻。
已确认
- The Information 报道了 Astra 采用循环深度技术的消息,@dotey、@JacquesThibs、@dlweekly 等多个账号转述。
- 循环 Transformer 技术路线有学术支撑:@bookwormengr 引用的 arXiv 2506.18233 给出其缩放律,核心发现是增加循环不涨知识、只涨推理。
- Günter Klambauer(@gklambauer)的新论文 SE-RRM 仅用 200 万参数即在 ARC-AGI 上打平,验证了循环推理模型(RRM)思路的有效性。
- The Information 报道中也提到有专家认为监控方面的担忧「关系不大」(@dotey 转述)。
尚未确认
- Astra 是否真采用循环深度架构未被官方证实;@gklambauer 明确表示其「GPT-6 Astra 可能用循环深度」的说法是基于自家 RRM 工作的猜测。
- 「隐藏推理」的解读存在争议:Sebastian Raschka(@rasbt)发长文降温,认为循环结构并非在隐藏推理,省 token 可能只是因为模型更聪明,而非刻意掩盖思维过程。
为什么重要
- 循环深度提供了一条不依赖完整思维链输出的高性能路线,可显著控制推理成本;但若思考过程不可见,外部审计与安全监控的难度将上升。
- 相关学术工作(缩放律研究、SE-RRM)表明该方向在小参数规模上已有实证效果;若传闻属实,可能代表大模型推理架构的一次重要转向。
- 循环 Transformer 缩放律:加循环不涨知识,只涨推理 — bookwormengr · 2026-09-04
- 研究者猜测 GPT-6 Astra 或用循环深度,SE-RRM 论文仅 200 万参数打平 ARC-AGI — gklambauer · 2026-09-04
- rasbt 拆解 Astra「循环深度」传闻:省 token 或因更聪明而非隐藏推理 — rasbt · 2026-09-04
- OpenAI Astra 用「递归深度」新推理路径,但思维过程更难监控 — JacquesThibs · 2026-09-05
- 曝 OpenAI Astra 用"循环 Transformer"隐藏内部推理,监控引担忧 — dotey · 2026-09-06
- The Information:OpenAI Astra 用循环深度隐藏内部推理,专家称关系不大 — dotey · 2026-09-06
- OpenAI Astra「不透明递归」推理技术引发 AI 安全界警报 — dl_weekly · 2026-09-06