Astra 传闻中的 looped transformer 并非黑科技:只复用层堆栈
rasbt · x · 2026-09-02
The Information 报道称 OpenAI 的 Astra 是一种 "recurrent depth / looped transformer",并暗示新方法可能隐藏思维链。rasbt 对此做了技术科普式的 debunk:
- Looped transformer 本质:复用同一层堆栈多次。以开源的 Nanbeige4.2-3B 为例,它把同一个 22 层堆栈跑两遍,相当于 44 层深度但不复制权重——存储和内存不变,但计算成本约翻倍。
- 实测数据:Nanbeige 技术报告显示两遍 pass 是最佳折中,保留约 75% 的 token 效率;更多遍几乎没有收益且训练显著变慢变贵。
- 思想渊源:更早的 NeurIPS 论文 "Mixture-of-Recursions" 更精细,用可学习路由决定每个 token 走 1 次还是多次 pass,简单 token 提前退出。
作者结论:Astra 或许是好模型,但 "looped transformer" 只是小小的架构调整,不值得炒作;复用层本身并不会压制可见的思维链,只是把更多计算放入隐状态。若推理被隐藏,更可能的解释是更多 recurrent pass 减少了显式推理 token 的生成——也可能记者误读或另有所指。
所属事件:曝 OpenAI Astra 采用循环深度实现潜空间静默推理(81 条相关)→
「模型」频道最新
- 爆料称 9 月将有两款重磅开源模型发布 — lqiao · 2026-09-02
- Bug Hunt 榜单:Fable 5.1 low 更便宜且胜过 Opus 5 max — PawelHuryn · 2026-09-02
- Gemini 3.8 Flash 现身 GCP Agent Studio,主打多模态与编码场景 — testingcatalog · 2026-09-02
- 某模型 ARC-AGI-2 得分 90%,单任务成本降至 3.12 美元 — eyishazyer · 2026-09-02
- 用户吐槽 GPT 近几周八成回答以「Yes」开头 — Standard-Metal-3836 · 2026-09-02
- Fable 5.1 修复前代模型荒唐决策:每次按键都对图标像素做 SHA-256 — johnlindquist · 2026-09-02