OpenAI 新技术削弱 CoT 可监控性,AI 安全圈激辩监控替代方案
据 The Information 报道,OpenAI 的新技术降低了模型思维链(CoT)的可监控性,这一消息在 AI 安全研究圈引发持续多日的激烈争论,核心分歧在于:CoT 监控是否本就不可靠、能否被机械可解释性替代、何时该放弃。这是 CoT 监控作为前沿 AI 安全关键手段面临的首次大规模公开质疑,值得所有关注模型治理与可解释性的人留意。
已确认
- 据 The Information 报道(由 Gary Marcus 转述并呼吁重读 2025 年论文《Chain of Thought Monitorability: A New and Fragile Opportunity》),OpenAI 新技术降低了 CoT 的可监控性。
- Anthropic 可解释性方向研究者 jachiam0 提出:CoT 保真度天然脆弱,从一开始就不该被当作长期 AI 安全的兜底手段;保护 CoT 保真度有价值,但把「思维链必须对人类可读」上升为原则并不合理。scaling01 也猛烈抨击 CoT 监控论调,断言机械可解释性才是更合理的方向。
- 研究员 thlarsen 表达担忧:他此前认为短期内 AI 会失准(misaligned)但可通过阅读 CoT 获取证据,如今判断我们将失去这一渠道;CoT 被隐藏后,只能依赖工具调用或代理行为推断,且必须信任 AI 的自我报告,实质性调查几乎无法进行,且进展速度可能快于「AI 2027」类预期。
- Anthropic 研究员 Jack Lindsey 明确表示,白盒技术(如激活解码)不太可能在一年内提供与 CoT 相当的可监控性:目前能捕捉部分未言明的想法/计划,但可靠性远不及 CoT;他对「几年内」取得进展表示乐观,团队已有两个激活解码技术用于生产监控。Ryan Greenblatt 也不认为一年内会出现强且真正可用的机械可解释性监测。
- 前者被 tszzl 的预测直接挑战:他预测未来一年内将出现帕累托优于 CoT 监控器的机械可解释性监控方案,理由是「可监控性」是必须保持的不变量。nablatheta 同样认为 mech interp 一年内难以达到理想状态,目前实用方案依赖脆弱的 OOD 泛化,激进方案甚至无法解释 GPT-0.5。
- Nick Cammarata(前 Anthropic)认为 CoT 监控开始失效令人遗憾,应尽力阻止这一趋势,但真正能搞清神经网络在做什么的是可解释性,他对其前景从未如此乐观。
尚未确认
- OpenAI 新技术具体指什么、对 CoT 可读性的实际影响程度,帖中未给出细节,仅有 The Information 报道的转述。
- 机械可解释性/白盒监控能否在一年内超越 CoT 监控,研究者预测相互冲突,尚无定论。
为什么重要
- 这场争论实质上是「安全冗余与模型性能」的权衡:jachiam0、Darpinian 等人认为行业转向隐性推理是必然趋势,监控 CoT 会阻碍模型性能,应转向外部机制与可解释性;yonashav、Gary Marcus 等人则强调,即使 CoT 监控迟早会失效,在缺乏长期替代方案前主动放弃这一有用的中间手段并不合理——Gary Marcus 称在没有更好替代方案之前踢开这摇摇欲坠的脚手架是疯狂之举;Micah Carroll 也指出替代方案几个月内未必能就绪,在被证明更好之前 CoT 仍是默认的最佳监控手段。
- maksymandr 列出了 CoT 之外的监控选项:基于行为的监控(action-only monitors)、基于探针的监控、激活层监控等,为后续讨论提供了路线图。
- 若 CoT 可读性持续弱化,实验室与政府发现并验证 AI 失准行为的能力将显著下降,这正是《CoT Monitorability》论文作者(含 Bengio 等联署)试图预警的风险。
2026-09-02 ~ 2026-09-03 · 32 条相关
一手来源
- Anthropic研究员:一年内白盒监控难替代CoT可监控性 — Jack_W_Lindsey ·
- 预测未来一年:机械可解释性监控将超越思维链 — tszzl ·
- 传 OpenAI 新技术削弱 CoT 可监控性,Bengio 等联署论文作者回应 — GaryMarcus ·
- 观点:强制 CoT 可读性可能削弱 LLM 对齐 — JacquesThibs · 2026-09-02
- CoT 隐蔽将使 AI 对齐调查几乎无法进行 — thlarsen · 2026-09-02
- 专家激辩:因“未来会失效”而放弃 CoT 监控是否合理? — yonashav · 2026-09-02
- Gary Marcus:移除脆弱的CoT脚手架是疯狂之举 — GaryMarcus · 2026-09-02
- 观点:放弃监控CoT,转向隐性推理与外部解释是必然 — Darpinian · 2026-09-02
- 前Stripe工程师:模型远未失控,HF事件只是未被察觉 — Darpinian · 2026-09-02
- Anthropic人士:恶意人类用模型比失控风险威胁更大 — Darpinian · 2026-09-02
- CoT 监控恐失效:AI 失准更难察觉,进展快过 AI 2027 预期 — AaronBergman18 · 2026-09-02
- 研究员担忧 CoT 可监控性下降趋势 — tomekkorbak · 2026-09-02
- 【源头】预测未来一年:机械可解释性监控将超越思维链 — tszzl · 2026-09-02
- 探讨模型电路计算:任何电路计算都是神经语言 — tszzl · 2026-09-02
- 预测一年内机制解释性监控将超越思维链 — aiamblichus · 2026-09-02
- MechInterp 难以在一年内取代 CoT 监控 — nabla_theta · 2026-09-02
- 批 CoT 可监控性论调:机械可解释性更靠谱 — scaling01 · 2026-09-02
- Ryan Greenblatt 不看好一年内出现可用的机械可解释性监测 — connoraxiotes · 2026-09-02
- 研究者质疑 CoT 可读性原则:靠思维链保安全注定失败 — zetalyrae · 2026-09-02
- Anthropic 研究员:依赖思维链可读性的安全策略注定失败 — inductionheads · 2026-09-02
- 研究者押注:前沿模型前向传播正逼近「神经密语」式电路计算 — EigenGender · 2026-09-02
- CoT 监控之外还有什么?可解释性研究者列出四层监控方案 — maksym_andr · 2026-09-02
- 【源头】Anthropic研究员:一年内白盒监控难替代CoT可监控性 — Jack_W_Lindsey · 2026-09-02
- latent reasoning 伤安全监控?CoT 本就是看茶叶,架构一改就崩的方法不可靠 — juliusadml · 2026-09-03
- 【源头】传 OpenAI 新技术削弱 CoT 可监控性,Bengio 等联署论文作者回应 — GaryMarcus · 2026-09-03
- CoT 可解释性为何天然脆弱:专家论证不可见激活无法构成审计记录 — GaryMarcus · 2026-09-03
- 白盒技术一年内难替代 CoT 监控,学界激辩何时该停训 — tszzl · 2026-09-03
- 安全研究者激辩:失去 CoT 后,模型可监控性还能靠什么 — LauraRuis · 2026-09-03
- Nick Cammarata:COT 监控渐失效,可解释性才是正解 — nickcammarata · 2026-09-03
- Boaz Barak 谈 CoT:在验证替代方案前放弃是不负责任的 — inductionheads · 2026-09-03
- CoT 非唯一观测手段,但移除显式推理削弱纵深防御 — schwarzjn_ · 2026-09-03
- AI 安全研究者:OpenAI 放弃 CoT 可读性承诺,思维链本就靠不住 — schwarzjn_ · 2026-09-03
- 研究者呼吁加大 action-only 监控投入:OpenAI 转向后暴露投入不足 — maksym_andr · 2026-09-03
- 对齐监控开放问题清单:仅监控行动、智能差多大才算致命? — xeophon · 2026-09-03
另有 1 条近重复转述:hunarbatra