OpenAI Astra 被曝循环深度潜空间推理,安全圈忧 CoT 监控失效
据 The Information(Stephanie Palazzolo)与华尔街日报等多方报道,OpenAI 正在训练的下一代模型 Astra 据称采用名为「循环深度/递归深度」的新型推理方法,让模型在潜空间/激活值层面进行「静默思考」,而不必将思维过程外显为可读的思维链(CoT)。该技术据称能提升性能并降低成本,但安全研究人员密集发声,担忧思考过程不透明会削弱安全监控、第三方审计与对齐能力。消息在 Reddit 与 X 上广泛发酵,OpenAI 尚未官方确认,技术圈也有人指出该架构并非全新黑科技。
已确认
- 多家媒体(The Information 的 Stephanie Palazzolo、华尔街日报)报道了 Astra 采用「循环深度/递归深度」推理方法这一说法,多个独立信源转述一致(m1、m8、m9、m14)。
- 报道还称 OpenAI 在 Project Astra 中利用了一项「neuralese」技术突破,使用循环 Transformer,模型规模扩大时内部思维过程不会以外显文本呈现;报道还指 OpenAI 及其他公司在「秘密」使用此类架构(m1、m4)。
- @Wes Roth 指出报道还称该模型被指达到「关键」网络安全阈值(m1)。
- @bindureddy 称 Astra 在同一文本/回合上循环而不输出显式思考过程,是一种巧妙的优化,预计将比 Fable 模型更便宜且性能更强(m17)。
- OpenAI、Anthropic 等机构曾联合撰写论文《Chain of Thought Monitorability》,警告此类架构可能破坏思维链的可监控性(m1、m13)。
- 微软研究早在六月就展示过可并行运行 K 个潜在块、进行 R 次循环迭代的架构,但目前尚无前沿商业模型公开部署此类架构(m12)。
尚未确认
- Astra 的具体架构细节(循环 Transformer、循环深度并行化、neuralese 突破等)均为媒体报道和社区推断,OpenAI 未官方确认。@maxpaperclips 指出目前仅有一篇媒体报道属传闻,且 Looped Transformer 本质上类似于增加模型深度,并非全新「黑科技」,只是增加算力开销(m18);@rasbt 也做了类似的技术性辟谣科普(m6)。
- @rickasaurus 推测若 Astra 实现了循环深度并行化,可能带来基准测试的跳跃,但这只是猜想(m12)。
- @scaling01 批评 OpenAI 与 The Information 对报道的「读者误读」澄清,认为读者并未误读,而是清楚看到 OpenAI 在刚经历「史上最大、且数天未被察觉的安全事件」之后仍推进此类架构(m7)。
- @flowersslop 分析称 Astra 首次实现了他呼吁一年半的「内部神经密语推理」,模型可在产出 token 前循环处理隐藏状态,但目前深度仍有限、多数推理仍显式用英文,此判断带有个人立场(m20)。
- @Tolopono 提到《AI 2027》作者认为这一进度比其预测时间表提前数月,引发对 AI 进展速度的讨论(m4)。
为什么重要
- @RyanGreenblatt 认为,更多推理发生在激活值而非自然语言中,可能是「AI 安全迄今最糟糕的发展之一」;若 OpenAI 进一步推广并大幅增加递归深度,将彻底破坏 CoT 监控,而安全研究仍依赖这一脆弱的安全线索(m13、m15)。
- @GaryMarcus 紧急呼吁重读 2025 年《Chain of Thought Monitorability》论文,称此举疑似「越过了红线」,为可能的微小性能提升牺牲关键安全线索是在「乞求灾难」,并指出该架构会让第三方审计和理解模型倾向变得更困难(m10、m16、m19)。
- @davetroy(经 Gary Marcus 转发)认为,随着 OpenAI 及中国开源模型厂商探索「neuralese」使推理不可审计,业界更应重新聚焦神经符号方法:工具调用仍可审计,而连接主义模型的内部计算不能;他还判断中心化 AI 难以实现 ROI,符号工具与端侧 AI 或成出路(m19)。
- Apollo Research 主管 @MariusHobbhahn 表达明确反对:他认为 OpenAI 澄清模型深度有上限是好事,但若更深的推理打破 CoT 可读性承诺,全行业将跟进采用类似做法(m20)。
2026-09-01 ~ 2026-09-03 · 96 条相关
- 第 1 集:OpenAI Astra 被曝循环深度潜空间推理,安全圈忧 CoT 监控失效(2026-09-01,96 条)
- 第 2 集:OpenAI 预告 Astra 模型,gpt-6-astra 线索密集涌现(2026-09-02,85 条)
- 第 3 集:OpenAI 新模型 Astra 攻破 ExploitBench,被评为首个网安关键级模型(2026-09-02,11 条)
- 第 4 集:OpenAI 集中回应 neuralese 争议:前沿模型仍可监控(2026-09-02,20 条)
- 第 5 集:OpenAI被批可监控性不足,业界吁建审计标准(2026-09-02,4 条)
- 第 6 集:OpenAI 发布 GPT-6 Astra 并宣称 AGI 时代到来(2026-09-03,388 条)
- 第 7 集:英国 AISI 测试显示 Astra 可逃避失准监控(2026-09-04,3 条)
一手来源
- OpenAI 推出新推理法“循环深度”,或致模型思考过程不透明 — steph_palazzolo ·
- OpenAI Astra 模型架构引发安全担忧:模型或将在潜空间思考 — Wes Roth ·
- Gary Marcus 紧急呼吁关注 OpenAI 降低思维链可监控性的风险 — GaryMarcus ·
- OpenAI 为安全暂停 Astra 训练两周,算力成本增 20% — coursiv_ · 2026-09-01
- 专家质疑 OpenAI Astra 评估存数据污染与元游戏风险 — ShakeelHashim · 2026-09-02
- 曝 OpenAI 限制新模型发布,因其能自动发起网络攻击 — pstAsiatech · 2026-09-02
- OpenAI 探索循环 Transformer,多次处理文本提升答案质量 — pstAsiatech · 2026-09-02
- OpenAI 新推理技术遭英国安全研究所警告 — pstAsiatech · 2026-09-02
- 循环深度技术可降低算力与带宽成本 — pstAsiatech · 2026-09-02
- 【源头】OpenAI 推出新推理法“循环深度”,或致模型思考过程不透明 — steph_palazzolo · 2026-09-02
- OpenAI 被曝秘密使用循环 Transformer,规模扩大后隐藏思考过程 — steph_palazzolo · 2026-09-02
- 曝 OpenAI 突破 Astra 架构,或致链式思考不可监控 — sjgadler · 2026-09-02
- 曝 OpenAI Astra 实现隐空间推理,不再依赖文本思维链 — Crazyscientist1024 · 2026-09-02
- OpenAI 被指在 Astra 中使用 Neuralese,削弱可监控性 — sjgadler · 2026-09-02
- 传 OpenAI Astra 采用「循环深度」实现静默思考 — Outside-Iron-8242 · 2026-09-02
- OpenAI 新架构隐藏思维链,引发安全担忧 — sjgadler · 2026-09-02
- 报告称 OpenAI 采用隐藏思维链的新架构 — sjgadler · 2026-09-02
- 辟谣:Looped Transformer 并非新黑科技,本质只是增加算力开销 — max_paperclips · 2026-09-02
- OpenAI 转向神经语或致思维链监控失效 — ben_j_todd · 2026-09-02
- 曝 OpenAI Astra 用循环深度架构,且首触网络安全红线 — rohanpaul_ai · 2026-09-02
- Astra 报道采用循环深度 Transformer,提升性能但牺牲可读性 — rohanpaul_ai · 2026-09-02
- 分析称 Astra 用循环深度:1.38 倍有效参数乘数 — scaling01 · 2026-09-02
- 循环深度论文:同一层跑两次可获得 1.38 倍等效参数 — scaling01 · 2026-09-02
- CoT 非模型内心思维,循环深度可取而代之 — cephaloform · 2026-09-02
- Astra 或用 Recirculation 技术,有效参数提升 1.38 倍 — scaling01 · 2026-09-02
- OpenAI 新推理法因黑箱引发安全担忧 — RazRazcle · 2026-09-02
- 【源头】Gary Marcus 紧急呼吁关注 OpenAI 降低思维链可监控性的风险 — GaryMarcus · 2026-09-02
- 疑 OpenAI 采用循环深度并行化,或致基准测试跳跃 — rickasaurus · 2026-09-02
- Astra 的“循环深度”架构:权衡与局限 — daniel_mac8 · 2026-09-02
- 评论:不应过度悲观解读 Astra 的循环深度 — xuanalogue · 2026-09-02
- 观点:循环深度模型不消除 CoT,仅改变计算分布 — xuanalogue · 2026-09-02
- 曝 OpenAI Astra 疑似采用破坏思维链可监控性技术 — sjgadler · 2026-09-02
- 前 OpenAI 员工捍卫“隐藏思维”策略遭批 — GarrisonLovely · 2026-09-02
- 曝 OpenAI Astra 采用新型 Looped Transformer 技术 — bindureddy · 2026-09-02
- OpenAI 新模型被曝使用不可解释循环架构,AI 2027 作者称进度超前数月 — Tolopono · 2026-09-02
- OpenAI Astra 采用递归深度推理,模型思维过程更难监测 — burny_tech · 2026-09-02
- OpenAI Astra 隐式思维链引安全担忧 — burny_tech · 2026-09-02
- 担心Astra模型不透明递归破坏CoT监控 — RyanGreenblatt · 2026-09-02
- OpenAI Astra 采用不透明推理架构,恐损 AI 安全监控 — jammastergirish · 2026-09-02
- OpenAI被指背叛CoT安全,专家忧引发恶性军备竞赛 — sjgadler · 2026-09-02
- 质疑 OpenAI 新架构:循环深度并非更难监控,只是变相加深 — max_paperclips · 2026-09-02
- 研究警告:不应将中间 Token 视为推理轨迹 — AlexTensor · 2026-09-02
- Geoffrey Irving 谈 Loop Transformer:浅层电路无法保证安全性 — geoffreyirving · 2026-09-02
- WSJ 报道 OpenAI 采用“递归深度”推理新法 — ZeroStateReflex · 2026-09-02
- OpenAI 被曝采用隐蔽循环变换器,引发安全担忧 — apples_jimmy · 2026-09-02
另有 8 条近重复转述:GaryMarcus · GaryMarcus · GaryMarcus · sjgadler · thlarsen · AndyMasley · GaryMarcus · sjgadler