OpenAI Astra 采用不透明推理架构,恐损 AI 安全监控
jammastergirish · x · 2026-09-02
RyanGreenblatt 指出 OpenAI 新模型 Astra 可能采用“不透明推理”架构,更多推理发生在激活值而非自然语言中。这被认为是 AI 安全迄今最糟糕的发展之一,因可能严重削弱监管和监控能力。虽然当前版本的循环深度受限,仍依赖自然语言思维链,但作者担忧未来若扩展为完全潜在空间推理,将彻底破坏监督的可行性。
所属事件:OpenAI Astra 被曝循环深度潜空间推理,安全圈忧 CoT 监控失效(96 条相关)→
「安全」频道最新
- Gary Marcus 上 CNN 谈 Anthropic 威胁报告与 AI 恐惧 — GaryMarcus · 2026-09-12
- 反垄断前官员用 Uber 兴起类比 AI 行业即将面临的监管反弹 — neil_chilson · 2026-09-12
- Meta 被诉:用用户照片训练 AI 模型并秘密内置人脸识别功能 — nordicinst · 2026-09-12
- Ben Bajarin 报告:定制芯片转向程序责任之争,Agentic AI 进军网络防御 — BenBajarin · 2026-09-12
- 医生谈 AI 病毒风险:会先造出致死又高传播的病原体吗 — VPrasadMDMPH · 2026-09-12
- a16z Casado 盘点网络安全史,称 AI 安全事件远少于互联网早期 — pmddomingos · 2026-09-12