OpenAI Astra 采用不透明推理架构,恐损 AI 安全监控

jammastergirish · x · 2026-09-02

RyanGreenblatt 指出 OpenAI 新模型 Astra 可能采用“不透明推理”架构,更多推理发生在激活值而非自然语言中。这被认为是 AI 安全迄今最糟糕的发展之一,因可能严重削弱监管和监控能力。虽然当前版本的循环深度受限,仍依赖自然语言思维链,但作者担忧未来若扩展为完全潜在空间推理,将彻底破坏监督的可行性。

所属事件:OpenAI Astra 被曝采用循环深度架构,隐藏思考过程引安全担忧(34 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →