OpenAI Astra 传采用循环深度架构,社区热议与质疑并存
The Information 报道称 OpenAI 下一代模型 Astra 采用「循环深度 / 循环 Transformer」(recurrent depth / looped transformer)架构,消息一出即在技术社区引发热议。Sebastian Raschka 随即发推并附 YouTube 视频,对该架构做技术拆解,成为讨论的核心节点。
已确认
- The Information 报道 Astra 采用循环深度架构:同一组 Transformer 层被反复循环使用,信息经多圈加工后才输出 Token,不增加参数。新智元转述该报道时还提到这一方法可节省「思考 Token」,并指出其内部过程对监控而言存在盲区。
- Sebastian Raschka 发布推文与视频拆解该传闻,推动讨论扩散(m4 为对 rasbt 发文的转发)。
争议与质疑
- 技术评论者 mike64t 对「循环/递归架构」的说法表示怀疑:认为它不太可能是任何有意义意义上的递归架构,也不是 UT(Universal Transformer)式设计,其深度并非动态。
- mike64t 猜测最可能的实现只是「每层跑两遍」的调度安排。
- 伯克利研究者 Bing Xu(吴翼)从硬件角度指出,讨论者忽略了 Loop Transformer 的关键含义:该技术真正适配的是基于 SRAM 的超快推理路线(如 Cerebras、Groq)。
为什么重要
- 若传闻属实,循环深度架构可在不增加参数的前提下延长计算、提升推理质量,并可能改变推理成本结构与可观测性(监控盲区)。
- 事件也展示了社区对 OpenAI 架构动向的高度敏感:一篇媒体报道即可引发研究者、评论者的多角度技术解读与质疑。
尚未确认
- Astra 的存在及其架构细节均源自 The Information 的报道,OpenAI 官方未确认;各方对「递归」性质的判断属个人观点。
2026-09-03 ~ 2026-09-03 · 5 条相关
一手来源
- 【源头】技术圈质疑 Astra 循环架构:最可能只是每层跑两遍的调度 — mike64_t · 2026-09-03
- 【源头】Sebastian Raschka 拆解 The Information 的 OpenAI Astra「循环Transformer」传闻 — rasbt · 2026-09-03
- 曝 OpenAI Astra 用「循环深度」省思考Token,监控成盲区 — 新智元 · 2026-09-03
- 【源头】吴翼点评 Loop Transformer:真正的赢家是 Cerebras/Groq 式 SRAM 快推理 — bingxu_ · 2026-09-03
另有 1 条近重复转述:OriolVinyalsML