Raschka 深度解读 GPT-6 Astra:循环深度 transformer 与隐藏思维链
AxSaucedo · x · 2026-09-15
Sebastian Raschka 发布长文,解析 OpenAI 新模型 GPT-6 Astra 与「looped transformer」架构研究的关系。
- Astra 实测印象:他认为 Astra 是目前用过最好的模型,全面超越 GPT-5.6(写作、数学、编码等),尤其在 3D 渲染与动画类图形 demo 上表现突出,编程与数学 benchmark 成绩也显著领先。
- 核心议题:围绕 Astra 采用循环深度(recurrent depth)的传闻,系统讲解 looped transformer 的原理——即重复使用同一组 transformer block 多次迭代,形成隐式的内部推理链。
- 隐藏思维链:讨论了「Astra 隐藏推理轨迹」的说法与循环架构的关联,梳理近期相关研究论文的新发现,以及这类架构对未来模型隐式推理能力的意义。
所属事件:Raschka 深度解读 GPT-6 Astra 循环架构与隐藏思维链争议(2 条相关)→
「模型」频道最新
- 覆盖度实测三轮:DeepSeek V4.1 Flash 21.7→33 分 — PawelHuryn · 2026-09-15
- ChatGPT Plus 转 Business 值不值?用户求解 Sol High 用量上限差异 — geler1 · 2026-09-15
- Tinfoil 团队:开源安全分类器研究严重稀缺,呼吁头部实验室开放 — yuntiandeng · 2026-09-15
- 争论:依赖单一 AI 厂商比开放模型更危险 — xeophon · 2026-09-15
- Grok 5 路线图曝光:Gemma 4.0 Pro 泄露与 Opus 5.2 预览汇总 — WorldofAI · 2026-09-15
- 用户实测:DeepSeek v4.1 Flash 是「能真正干活」的小模型下限 — solyarisoftware · 2026-09-15