Raschka 长文拆解 GPT-6 Astra:循环深度、隐藏推理与 Looped Transformer
bibryam · x · 2026-09-09
Sebastian Raschka 发布长文,系统讨论 GPT-6 Astra 与「循环深度 / 隐藏思维链」传闻,以及 Looped Transformer 的最新研究。
1. GPT-6 Astra 初印象
- 他认为 Astra 是目前用过的最好模型,全类别(写作、数学、编程)全面超越前代 GPT-5.6
- 3D 渲染与动画类 demo 的提升尤为突出,编码与数学基准成绩也很强
2. 文章结构
- 逐一讨论架构传闻:Astra 是否采用 looped transformer / recurrent depth
- 是否存在「隐藏推理过程」(不暴露完整 chain of thought)的设计
- 梳理 looped transformer(重复使用同一组 transformer 块)的原理与近期论文的新发现
适合想理解「用深度循环替代简单堆叠层数」这条架构路线的读者。
所属事件:Raschka 长文拆解 GPT-6 Astra 循环深度与隐藏推理(3 条相关)→
「模型」频道最新
- 传 OpenAI 内部模型强于 GPT-6,曾解 Navier-Stokes 难题 — haider1 · 2026-09-09
- Thomson Reuters 基于 Qwen 自训 397B 法律大模型,合规场景胜 GPT-5.4 — DeepLearningAI · 2026-09-09
- 浏览器里跑 27B 1-bit 模型:6GB 3060 笔记本达 25-30 tok/s — mentria-ai · 2026-09-09
- GPT-6 Astra Pro/Ultra 实测:首个几乎次次正确执行 one-shot 的 LLM — rschu · 2026-09-09
- Raschka 拆解 GPT-6 Astra:循环深度与隐藏思维链真相 — rasbt · 2026-09-09
- Agentic 视频理解关键不在看完整片,而在学会按需分配算力 — romitheguru · 2026-09-09