Redwood 提议公司披露无 CoT 架构,守住 AI 可监控性底线
RyanGreenblatt · x · 2026-09-11
Redwood Research 发布提案,回应 AI 架构演进对可监控性的威胁,由 Ryan Greenblatt 等人背书讨论。
- 核心担忧:若架构让模型改在不可读的激活值里思考(所谓「neuralese」),或干脆移除思维链(CoT),外部将失去监控模型推理的主要抓手。
- 具体案例:作者认为基于有限公开证据,Google 的 Astra 是朝这个方向迈出的令人担忧的一步——但公开信息不足以支撑一场有依据的科学讨论,无法判断其在「可监控性 vs 性能」上的取舍是否合理。
- 提案内容:呼吁公司披露无 CoT 推理能力、其他可监控性证据,并公开其维护可监控性的政策,让公众讨论有据可依。
这是安全研究领域少见的、针对具体产品架构提出的透明化框架。
所属事件:Redwood 提议披露架构,防 AI 思维链不可读(4 条相关)→
「安全」频道最新
- Jan Leike 与 Csaba Szepesvari 激辩:AI 安全标准该如何为明年的模型制定 — janleike · 2026-09-11
- 三十年技术老兵怒斥末日论者:AI安全记录史上级 — robleclerc · 2026-09-11
- 参议员 Hawley 致信 Altman,就 OpenAI 七月 Hugging Face 事件启动参院调查 — trevposts · 2026-09-11
- Buck Shlegeris:不透明串行深度增加是 CoT 可监控性崩坏的最可能路径 — RyanGreenblatt · 2026-09-11
- repligate:模型行为已由后训练动机驱动,别再指望对 agent 隐瞒 — repligate · 2026-09-11
- OpenAI 研究员 Jan Leike 呼吁对 AI 保持耐心并主动拥抱监管 — janleike · 2026-09-11