Sebastian Raschka 解析 GPT-6 Astra 与 Looped Transformer 架构
ModelForge · hn · 2026-09-09
Sebastian Raschka 在其 Newsletter 中长文解析围绕 OpenAI 新模型 GPT-6 Astra 的传闻与技术讨论,重点落在 looped transformer(循环 transformer)架构与其「隐藏推理」能力的关系。
要点包括:
- Loop transformer 的核心思想是让部分层重复执行多次计算,用更深的有效计算深度换取参数效率,与「测试时计算」(test-time compute)思路相通。
- 文章讨论了这类架构能否解释 Astra 在推理任务上「花更多内部步骤」的行为表现,即所谓 hidden reasoning——模型在外部输出前进行的多次内部迭代。
- Raschka 同时区分了已证实的信息与社区推测,提醒读者对 GPT-6 Astra 的具体架构细节保持谨慎。
- 对 looped/recursive 架构的研究脉络(如 Universal Transformer 及近期相关工作)做了梳理,说明为何这条路线在推理成本上可能有优势。
「模型」频道最新
- Similarweb:ChatGPT 月活破 10.6 亿,连续 4 个月创新高 — FinanceYF5 · 2026-09-11
- PuzzleMask 用普通英文绕过全部 4 个 LLM 门卫模型 — TechNadu · 2026-09-11
- 曝 OpenAI Codex 或于本周末再发额度重置,Codex 负责人暗指常有 — umesh_ai · 2026-09-11
- 曝 OpenAI 用 Navier-Stokes 模型攻黎曼猜想与 P vs NP — 141_1337 · 2026-09-11
- 实测发现 OpenRouter 不稳定支持 Meta Muse effort 档位,欧盟付费也受阻 — PawelHuryn · 2026-09-11
- 用户实测:Codex 单轮烧掉 4700 积分,$200 额度 20 分钟未完成任务 — RileyRalmuto · 2026-09-11