rasbt 拆解 Astra「循环深度」传闻:省 token 或因更聪明而非隐藏推理

rasbt · x · 2026-09-04

The Information 报道称 OpenAI 的 Astra 模型采用「循环深度/looped transformer」架构,引发「隐藏推理 token」的争论。Sebastian Raschka 发长文降温:循环结构并非在隐藏推理 token——GPT 6 Astra 用的输出 token 比 GPT 5.6 Sol 少,更可能是模型本身更强(更多训练、更大),而非推理被隐藏。他以同代对比佐证:GPT 5.6 Sol 在智能指数上输出 token 比 GPT 5.6 Luna 少约 46%,但没人说 Sol 比 Luna 隐藏了更多推理。

所属事件:GPT-6 Astra 循环深度架构传闻引发热议(3 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →