Raschka 长文:Astra 循环 Transformer 并非隐藏思维链元凶
机器之心 · wechat · 2026-09-14
针对 GPT-6 Astra 发布前 TheInformation 关于「循环深度(recurrent depth)/循环 Transformer 会让推理过程不可见」的报道及后续争议,Sebastian Raschka 发长文拆解技术细节,结论是:循环架构并非思维链变短、难监控的原因。
Astra 使用印象
- Astra 几乎全面超越 GPT-5.6,在 3D 渲染/图形任务上领先尤为突出;ARC-AGI-3 得 99.9%(GPT-5.6 Sol 仅 7.8%),但综合智能体编程指数上并未大幅甩开对手。
- 计算机操作(computer use)是真正亮点:通过 Codex/ChatGPT 直接操作本地软件(如用鼠标在 MS Paint 重画照片)。
- OpenAI 采购数万台 Mac Mini/Studio 并非用于训练,而是作为 macOS 强化学习环境:截图→预测鼠标键盘动作→执行→以成败信号做 RLVR 式反馈。模型本体仍在约 10 万块 Grace Blackwell GPU 上训练。
循环 Transformer 原理
- 核心是让中间表示多次通过同一批权重不变的 Transformer 块,如 Nanbeige4.2-3B 把 22 个块用两轮等效 44 层,参数减半、省内存;2 轮是效率最优配置。
- 思路可追溯到 2018 年 Universal Transformer,近期还有字节 Ouro、谷歌 Mixture-of-Recursions 等工作。
关于隐藏思维链
- Raschka 否认循环架构是可监控性退步的元凶:更合理解释是强模型犯错更少、回溯更少,不需要那么长的「草稿纸」——GPT-5.6 家族 Luna 比 Sol 多用 80% token 达到相近性能,没人说 Sol 更不可解释。Astra 系统卡确实承认推理轨迹可监控性退步,但证据不支持归因于架构。
实用建议:新模型提示理解力更强,可考虑精简或重新生成 AGENTS.md/SKILL.md,旧的手把手指导反而可能束缚新模型。
所属事件:Raschka 深度解读 GPT-6 Astra 循环架构与隐藏思维链争议(2 条相关)→
「模型」频道最新
- 内部人士预告:OpenAI 本周还有多条重磅发布待出 — MickeySteamboat · 2026-09-15
- 用户吐槽订阅档位失衡:$200 档 20× 用量 vs $100 档仅 5× — NoOne_n13 · 2026-09-15
- 传 OpenAI 暂停 $200 ChatGPT Pro 新订阅,称 GPT-6 Astra 需求挤爆容量 — emmanuelvivier · 2026-09-15
- 重度 vibe coding 实测:Claude Pro 体验胜过 ChatGPT Plus — AdvertisingBubbly546 · 2026-09-15
- TerminalBench 计分口径不一:Astra 触发安全得 0 分,Fable 却换模型续跑 — xeophon · 2026-09-15
- 用量化金融类比 AI 竞赛:大厂先发优势终将随算法公开而消散 — willcb · 2026-09-15