OpenAI 新架构被指削弱思维链可监测性,安全圈警报拉响
ShakeelHashim · x · 2026-09-04
The Information 报道 OpenAI 新模型 Astra 采用了一种可能使推理更难被监测的新架构,引发安全圈对「neuralese」(神经网络原生隐式思维)的担忧。安全研究员 Ryan Greenblatt 称若属实,「可能是迄今对 AI 安全最糟糕的一次进展」。
文章科普了核心概念:
- 思维链的原理:模型把中间步骤写进「草稿本」再喂回输入,相当于自我笔记,让单步计算有限「深度」的模型能走得更远。近两年的推理能力进步大多源于此
- 安全价值:思维链让模型推理过程对人类可读,是监测模型是否策划欺骗/越权行为的重要窗口
- 争议点:若新架构让推理转向不可读的内部表征(neuralese),思维链监测这一安全抓手可能失效
作者认为需要区分噪音与实锤,并梳理了各方担忧的合理程度。
所属事件:OpenAI 削弱 CoT 可监控性传闻引发 AI 安全圈激辩(38 条相关)→
「模型」频道最新
- Databricks 评测:GPT-6 Astra 登顶 OfficeQA Pro 数据推理新 SOTA — downingARK · 2026-09-04
- 数学家实测 GPT-6 Astra:边写论证边在 Lean 里实时验证证明 — teortaxesTex · 2026-09-04
- Tavus 发布 Sparrow-2:主打轮次检测与打断处理的对话理解模型 — ycombinator · 2026-09-04
- ARC-AGI-3 实测:max 推理多花 10 倍 token,总成本反降三成 — i_dg23 · 2026-09-04
- 研究者指 OpenAI Astra 系统卡存在数学基准数据污染疑点 — dfrsrchtwts · 2026-09-04
- antirez:评价新模型别看 three.js demo,看它能否解决真实阻塞难题 — antirez · 2026-09-04