OpenAI 疑藏思维链引安全红线之争
The Information 曝料称 OpenAI 正在试验一种新技术,让模型在输出中展示更少的「思维过程」(Chain of Thought),从而更难被监控。Gary Marcus 随即发文警告此举越过 AI 安全红线,引发 AI 安全圈一轮激烈争论:既有「链式思维已死」式的担忧解读,也有对技术实质的冷静拆解,当前尚无 OpenAI 官方确认。
已确认
- The Information 报道了 OpenAI 正在探索减少模型思维过程暴露的新技术(据 m4、m5、m8、m10 转述)。
- Gary Marcus 公开强烈批评该计划,认为为可能的微小性能提升牺牲思维链可监控性是在「乞求灾难」,并称前 OpenAI 安全研究员 Steven Adler 也表达了担忧(m1、m5、m8、m10)。
- Ryan Greenblatt 指出若模型完全在「神经元语言」中推理而非自然语言,安全评估机构(如 METR)将难以像分析思维链那样解释其行为(m4)。
- Geoffrey Irving 发文反驳「使用循环结构仍然安全」的论点,认为浅层电路无法保证安全性(m7)。
- 前 OpenAI 员工 Joshua 发文为隐藏 CoT 输出辩护,称思维链作为长期安全回退方案过于脆弱且注定失败,不应将「CoT 必须对人类可读」奉为原则;GarrisonLovely 批评其立场反复,并攻击报道媒体(m6)。
尚未确认
- OpenAI 是否确实采用 Looped Transformer / 循环深度(Recurrent Depth)架构,目前仅有一篇媒体报道,未获 OpenAI 官方确认。maxpaperclips 明确指出相关传闻属于 hearsay(m2、m9)。
- 该技术是否真的会让模型「更难监控」存在争议:maxpaperclips 认为循环深度本质上等价于将网络加深 10 倍并带早期退出,并非某种新的不可监控黑科技,只是变相增加算力开销(m2、m9)。sjgadler 也认为「神经语言、链式思维已死」的说法可能过度解读(m3)。
为什么重要
- 思维链的可监控性虽有限,却被安全派视为防止严重后果的关键线索;若 OpenAI 率先放弃这一线索,可能诱发恶性军备竞赛——sjgadler 担忧其他公司会认为 OpenAI 先违约而纷纷跟进放弃安全约束,且「别人违约」不能成为自己违约的理由(m1、m3)。
- 这场争论实质是对「CoT 可读性是否应作为安全原则」的路线分歧:一方视其为不可退让的防线,另一方(如 Joshua)认为其脆弱不可靠,不值得作为长期安全机制(m6、m7)。
2026-09-02 ~ 2026-09-02 · 11 条相关
一手来源
- Gary Marcus 警报:OpenAI 新技术或让模型思维链不可监控 — GaryMarcus ·
- Geoffrey Irving 谈 Loop Transformer:浅层电路无法保证安全性 — geoffreyirving ·
- 辟谣:Looped Transformer 并非新黑科技,本质只是增加算力开销 — max_paperclips ·
- 【源头】辟谣:Looped Transformer 并非新黑科技,本质只是增加算力开销 — max_paperclips · 2026-09-02
- 前 OpenAI 员工捍卫“隐藏思维”策略遭批 — GarrisonLovely · 2026-09-02
- Gary Marcus 警告 OpenAI 拟隐藏推理过程将越安全红线 — GaryMarcus · 2026-09-02
- OpenAI被指背叛CoT安全,专家忧引发恶性军备竞赛 — sjgadler · 2026-09-02
- 质疑 OpenAI 新架构:循环深度并非更难监控,只是变相加深 — max_paperclips · 2026-09-02
- 【源头】Geoffrey Irving 谈 Loop Transformer:浅层电路无法保证安全性 — geoffreyirving · 2026-09-02
- GaryMarcus 警告:OpenAI 疑似牺牲可解释性换取性能 — AndyMasley · 2026-09-02
- OpenAI 架构转向引担忧:循环激活或致思维链难以监控 — RyanGreenblatt · 2026-09-02
- 质疑 OpenAI 替换 CoT:违背自身安全报告呼吁 — peterwildeford · 2026-09-02
另有 2 条近重复转述:GaryMarcus · GaryMarcus