rasbt 拆解 Astra「循环深度」传闻:省 token 或因更聪明而非隐藏推理
rasbt · x · 2026-09-04
The Information 报道称 OpenAI 的 Astra 模型采用「循环深度/looped transformer」架构,引发「隐藏推理 token」的争论。Sebastian Raschka 发长文降温:循环结构并非在隐藏推理 token——GPT 6 Astra 用的输出 token 比 GPT 5.6 Sol 少,更可能是模型本身更强(更多训练、更大),而非推理被隐藏。他以同代对比佐证:GPT 5.6 Sol 在智能指数上输出 token 比 GPT 5.6 Luna 少约 46%,但没人说 Sol 比 Luna 隐藏了更多推理。
所属事件:GPT-6 Astra 循环深度架构传闻引发热议(3 条相关)→
「模型」频道最新
- 给 Fable 5.1 写肢体动作标记,对话体验明显更顺 — repligate · 2026-09-05
- GPT-6 Astra 发布日额度不重置,用户抱怨 OpenAI 用量政策 — tobowers · 2026-09-05
- 模型会模糊记住「概念」而非原文:一场关于 SAE 特征与记忆的争论 — voooooogel · 2026-09-05
- 博主丢 PPT 模版给 GPT6 Astra,30 页大会幻灯片连头像都做对了 — vista8 · 2026-09-05
- 用 GPT 6 pro 全网搜集数十个 GPT-6 Astra 提示词合集 — vista8 · 2026-09-05
- 腾讯混元 Hy4 预览:770B 总参 49B 激活,原生 1M 上下文 Apache 2.0 — aftahi_ai · 2026-09-05