Raschka 深度解读 GPT-6 Astra:循环深度与隐藏思维链传闻
Ahead of AI (Sebastian Raschka) · rss · 2026-09-09
Sebastian Raschka 长文分析 OpenAI 新模型 GPT-6 Astra 及「looped transformer」架构传闻:
- 实测印象:Astra 是他用过最强的模型,全面超越 GPT-5.6,尤其在 3D 渲染/图形类任务上优势突出;ARC-AGI-3 得分 99.9%(前代 Sol 仅 7.8%)。但在 Artificial Analysis 等独立评测中,编码智能体能力领先但差距不大。
- 评测方法提醒:模型通常主要针对一个 harness 微调,独立评测的共享 harness 可能低估其实际表现。
- Computer use:Astra 在图形界面操作上显著领先(如他用鼠标在 MS Paint 里画画),预计未来模型训练将更多围绕 computer use 展开;与 OpenAI 采购数万台 Mac mini/studio 用于 RL 环境的报道相符——Mac 用于提供 macOS 训练环境而非训练算力。
- 实用建议:新模型对 prompt 理解更强,可考虑精简或重新生成 AGENTS.md/SKILL.md,旧的手把手指令可能反而束缚新模型。
- Looped transformers:文章后半部分讲解循环深度(recurrent depth)架构原理及其与「隐藏思维链」传闻的关系。
「模型」频道最新
- APEX-Agents 1.1 更新基准:Claude Fable 5.1 以 68.6% 居首 — amaarora · 2026-09-09
- 评论:前沿模型订阅必然「缩水通胀」,逼你升级到 API 付费 — StewartalsopIII · 2026-09-09
- 用户实测:高峰定价翻倍后,252M 缓存 token 一天只花 $0.75 — teortaxesTex · 2026-09-09
- 实测对比:Astra 长线程表现明显逊于 Sol,易跑偏失稳 — jdjohnson · 2026-09-09
- VC communism 时代落幕,前沿模型开始配给制,VC 求选模型心法 — StewartalsopIII · 2026-09-09
- "数据标注已死"遭质疑:cherry-pick 演示≠长尾能力 — chris_j_paxton · 2026-09-09