OpenAI Astra 被曝循环深度潜空间推理,安全圈忧 CoT 监控失效

据 The Information(Stephanie Palazzolo)与华尔街日报等多方报道,OpenAI 正在训练的下一代模型 Astra 据称采用名为「循环深度/递归深度」的新型推理方法,让模型在潜空间/激活值层面进行「静默思考」,而不必将思维过程外显为可读的思维链(CoT)。该技术据称能提升性能并降低成本,但安全研究人员密集发声,担忧思考过程不透明会削弱安全监控、第三方审计与对齐能力。消息在 Reddit 与 X 上广泛发酵,OpenAI 尚未官方确认,技术圈也有人指出该架构并非全新黑科技。

已确认

尚未确认

为什么重要

2026-09-01 ~ 2026-09-03 · 96 条相关

事件全程(共 7 集)→

一手来源

另有 8 条近重复转述:GaryMarcus · GaryMarcus · GaryMarcus · sjgadler · thlarsen · AndyMasley · GaryMarcus · sjgadler