OpenAI Astra 采用不透明推理架构,恐损 AI 安全监控
jammastergirish · x · 2026-09-02
RyanGreenblatt 指出 OpenAI 新模型 Astra 可能采用“不透明推理”架构,更多推理发生在激活值而非自然语言中。这被认为是 AI 安全迄今最糟糕的发展之一,因可能严重削弱监管和监控能力。虽然当前版本的循环深度受限,仍依赖自然语言思维链,但作者担忧未来若扩展为完全潜在空间推理,将彻底破坏监督的可行性。
所属事件:OpenAI Astra 被曝采用循环深度架构,隐藏思考过程引安全担忧(34 条相关)→
「安全」频道最新
- OpenAI 网络安全模型 Astra 曝光:ExploitBench 满分 — LingmingZhang · 2026-09-02
- 安全界预警:AI 安全案例三大支柱恐将崩塌 — sjgadler · 2026-09-02
- OpenAI 被指采用“循环深度”推理法,引发安全界担忧 — sjgadler · 2026-09-02
- Amir 澄清:Astra 的思维链可监控,担忧在于未来技术扩散 — jachiam0 · 2026-09-02
- Safin-1:通过内存原生状态演变实现内生安全 — Shanghai-AI-Laboratory · 2026-09-02
- GaryMarcus 警告:OpenAI 疑似牺牲可解释性换取性能 — AndyMasley · 2026-09-02