OpenAI 新架构被指削弱思维链可监测性,安全圈警报拉响

ShakeelHashim · x · 2026-09-04

The Information 报道 OpenAI 新模型 Astra 采用了一种可能使推理更难被监测的新架构,引发安全圈对「neuralese」(神经网络原生隐式思维)的担忧。安全研究员 Ryan Greenblatt 称若属实,「可能是迄今对 AI 安全最糟糕的一次进展」。

文章科普了核心概念:

作者认为需要区分噪音与实锤,并梳理了各方担忧的合理程度。

所属事件:OpenAI 削弱 CoT 可监控性传闻引发 AI 安全圈激辩(38 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →