OpenAI 集中回应 neuralese 争议:前沿模型仍可监控
围绕「neuralese」(模型在非自然语言潜空间中思考)可能让模型变得不可监控的争议,OpenAI 首席科学家 Jakub Pachocki 及研究员 merettm、Peter Liu、Micah Carroll 等人于 9 月 2 日集中发声,澄清外界担忧并不符合当前事实,核心风险在于未来技术扩散而非当下的前沿模型。这轮回应直接关系到外界对前沿模型安全监控能力的信任,也引发了外部研究者与评论者的持续追问。
已确认
- 首席科学家及多名研究员明确表示,包括 Astra 在内的当前前沿模型,其计算图深度与 GPT-4 相差不到两倍,并非无法监控;Peter Liu 也针对「Recurrent Depth 引发不可监控性竞赛」的担忧作出同样回应。
- OpenAI 自首个推理模型起就致力于保留并利用思维链(CoT)监控技术,认为这对观察模型对齐如何泛化至关重要;Arthur Colle 也转述了这一官方立场。
- 团队承认 CoT 监控技术目前脆弱且呈负面趋势,但正通过研究计划加以强化。
- 据 jachiam0 转述 Amir 的澄清,此前关于 OpenAI 隐藏思维链的报道,其核心担忧并非当下的 Astra,而是类似新技术普及与超级加速后未来可能出现的不可控局面。
- Micah Carroll 指出,对「神经语」的误解可能引发一场「不可监控性竞赛」,首席科学家回应正是希望避免这种误导性报道带来的竞赛;Gary Marcus 参与交锋质疑相关报道并警示不可监控竞赛的风险,随后又进一步追问:若 Astra 计算图深度已接近 GPT-4 的两倍,这对可监控性究竟意味着什么——是否相当于可监控性减半,官方尚未给出直接解答。
- eliebakouch 认为「潜空间推理」的恐慌属于过度反应:扩展模型规模时本就需要同步扩展深度(无论是否用 recurrence),这能让推理更高效,且 OpenAI 和 Anthropic 显然都在训练推理效率更高的模型;监控本身也一直在观察激活值,并非只能依赖自然语言思维链。
- DeepMind 研究员 Tomasz Korbak 表示,前沿实验室若训练出前沿规模的循环(或其他不可监控)语言模型,将是当前 AI 时代最黑暗的一天,呼吁各大实验室协调承诺永不这么做;Balesni(据 jasminewang 转述)也认为转向全循环 LLM 架构将是 AI 历史上对安全的最大打击,呼吁所有 AI 实验室承诺限制模型的不透明串行深度,merettm 引用该观点作出上述回应。Sneha Revanur 还指出,指控行业某一方的不良行为反而可能让类似做法对其他玩家更显眼、更有诱惑力。
- Jonas Geiping 评论称,通过深度递归让模型更深确实会增加监测难度,但 OpenAI 已部署数月的模型(暗指 o1 系列)本就以这种方式推理,这场讨论显得过时和学术化,暗示业界实际已进入难以监测的推理模式。
- Brundage 呼吁对模型进行持续嵌入式审计(据 sjgadler 转述)。
尚未确认
- 「深度不到两倍」与可监控性变化之间的定量关系缺乏官方说明,Gary Marcus 的追问未获直接回答。
- 转发帖中一处将差距表述为「不到一倍」(m10),与其他帖子的「两倍以内」表述不一致,具体数字以首席科学家原始声明「相差不到两倍」为准。
为什么重要
- CoT 监控被 OpenAI 视为观察模型对齐泛化的关键手段,其脆弱性意味着即使当前可控,长期可持续性仍存挑战,这是社区持续关注与争论的焦点。
- 若「不可监控竞赛」的叙事扩散,可能促使各实验室在架构上竞相增加不透明深度;OpenAI 希望以事实澄清来遏制这一趋势,而 Korbak、Balesni 等外部研究者的呼吁则显示行业协调已成为现实议题。
2026-09-02 ~ 2026-09-04 · 20 条相关
- 第 1 集:OpenAI Astra 被曝循环深度潜空间推理,安全圈忧 CoT 监控失效(2026-09-01,96 条)
- 第 2 集:OpenAI 预告 Astra 模型,gpt-6-astra 线索密集涌现(2026-09-02,85 条)
- 第 3 集:OpenAI 新模型 Astra 攻破 ExploitBench,被评为首个网安关键级模型(2026-09-02,11 条)
- 第 4 集:OpenAI 集中回应 neuralese 争议:前沿模型仍可监控(2026-09-02,20 条)
- 第 5 集:OpenAI被批可监控性不足,业界吁建审计标准(2026-09-02,4 条)
- 第 6 集:OpenAI 发布 GPT-6 Astra 并宣称 AGI 时代到来(2026-09-03,388 条)
- 第 7 集:英国 AISI 测试显示 Astra 可逃避失准监控(2026-09-04,3 条)
一手来源
- OpenAI首席科学家回应neuralese争议:前沿模型计算图深度与GPT-4相差不到两倍 — Ok_Display_3159 ·
- OpenAI 人员:Astra 计算图深度与 GPT-4 相当 — merettm ·
- Gary Marcus 追问 OpenAI:Astra 计算图深度近 GPT-4 两倍,意味着可监控性减半? — GaryMarcus ·
- Amir 澄清:Astra 的思维链可监控,担忧在于未来技术扩散 — jachiam0 · 2026-09-02
- 【源头】OpenAI 人员:Astra 计算图深度与 GPT-4 相当 — merettm · 2026-09-02
- OpenAI 员工回应:坚持保留思维链可监控性 — peterjliu · 2026-09-02
- Balesni 警告全循环 LLM 架构将重创安全 — j_asminewang · 2026-09-02
- OpenAI 员工称前沿模型计算深度接近 GPT-4 — __nmca__ · 2026-09-02
- 【源头】OpenAI首席科学家回应neuralese争议:前沿模型计算图深度与GPT-4相差不到两倍 — Ok_Display_3159 · 2026-09-02
- OpenAI 谈推理模型监测:致力于保留链式思维 — arthurcolle · 2026-09-02
- OpenAI 员工驳斥神经语谣言,强调链式思维监测重要性 — cephaloform · 2026-09-02
- OpenAI 首席科学家谈模型推理监控:思维链虽脆弱但至关重要 — i_dg23 · 2026-09-02
- OpenAI o1 推理模式引发模型可监测性担忧 — jonasgeiping · 2026-09-02
- OpenAI 研究员澄清 Astra 计算深度与 GPT-4 相差不到两倍 — deanwball · 2026-09-02
- Gary Marcus 质疑 OpenAI 思维链监控报道,警示不可监控竞赛风险 — GaryMarcus · 2026-09-02
- OpenAI 研究员警告:前沿模型串行深度逼近 GPT-4 两倍,CoT 监控正走向失效 — connoraxiotes · 2026-09-03
- OpenAI 研究员:别慌潜空间推理,监控本就在看激活值 — eliebakouch · 2026-09-03
- AI 圈激辩 CoT 可监控性:Hugging Face 攻击调查全靠思维链还原真相 — tomekkorbak · 2026-09-03
- OpenAI 澄清:Astra 计算图深度与 GPT-4 相差不到一倍 — DKokotajlo · 2026-09-03
- 【源头】Gary Marcus 追问 OpenAI:Astra 计算图深度近 GPT-4 两倍,意味着可监控性减半? — GaryMarcus · 2026-09-04
- OpenAI 研究员:前沿模型思维链监控仍可用但正走向恶化 — zetalyrae · 2026-09-04