曝 OpenAI Astra 用「循环深度」省思考Token,监控成盲区

新智元 · wechat · 2026-09-03

据 The Information 报道,OpenAI 下一代模型 Astra 采用「循环深度」(Looped Transformer)新推理方法:同一组 Transformer 层被反复循环使用,信息多圈加工后才输出 Token,不加参数即可拉长有效计算深度。谷歌 2025 年论文显示 k 层循环 L 次可接近 k×L 层普通模型;另一项研究用 35 亿参数小模型循环出相当于 500 亿模型的推理成绩。

代价是思考过程「隐身」:原本必须挤在思维链字面上的长推理,现在可在潜空间里默默完成,人类与 OpenAI 自身都更难监控模型在想什么。OpenAI 首席科学家 Jakub Pachocki 回应称内部最前沿模型的计算图深度顶多是 GPT-4 的两倍,没外界传的那么玄乎。同时有大 V 爆料 gpt-6-astra 名字已在 OpenAI API 上现身,该架构对数学、编程类任务尤其有吸引力,还支撑了可连续运行数周的智能体。

所属事件:OpenAI Astra 传采用循环深度架构,社区热议与质疑并存(5 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →