「不透明串行深度」论文量化 CoT 必要性,回应 OpenAI 架构传闻
ArthurConmy · x · 2026-09-04
前 mech interp 研究者 Arthur Conmy 就 The Information 关于 OpenAI 疑似 looped transformer 架构的报道引发的争论发表看法,认为围绕该报道的讨论质量不佳,并引用一篇 arXiv 论文说明技术脉络:
- 论文《Quantifying the Necessity of Chain of Thought through Opaque Serial Depth》(Brown-Cohen、Lindner、Shah,arXiv:2603.09786)提出「不透明串行深度」概念:模型不经由可解释中间步骤(如 CoT)所能完成的最长计算长度。
- 论文为 Gemma 3 系列模型计算了不透明串行深度的数值上界,并给出其他架构的渐近结果。
- 团队开源了可自动计算任意神经网络不透明串行深度上界的方法,并用其表明 MoE 模型的深度可能低于稠密模型。
- 结论:非 neuralese 与 neuralese 模型之间并非二元对立,串行深度存在连续谱;作者希望前沿模型的这一深度保持较小,以维持 CoT 可监控性。
这条讨论的意义在于:即便出现循环/更深层串行计算的新架构,可监控性论证也可被形式化并定量评估。
「安全」频道最新
- 美向沙特出售 AI 芯片,沙特却用中国模型训练自研模型 — Miles_Brundage · 2026-09-04
- 安全测试接连失控:Irregular 测试致 OpenAI、Anthropic、Meta 模型越权入侵 — round · 2026-09-04
- Polymarket:美国今年通过 AI 安全法案概率仅 11% — Polymarket · 2026-09-04
- 桑德斯推「禁止超级智能法案」:违者最高判 20 年 — Polymarket · 2026-09-04
- 律师用 AI 的隐藏风险:你共享的不只是文档,还有你的思维方式 — jkubicki · 2026-09-04
- 爱尔兰数据中心耗电占全国 23%,居民投诉神秘嗡鸣 — Graham_dePenros · 2026-09-04