爆料者估算 GPT-6 Astra 或为 4.2T 参数循环语言模型
爆料账号 scaling01 于 9 月 28 日公布其对 OpenAI 下一代模型 GPT-6 "Astra" 的架构推测:中心估计为总参数约 4.2T、每 token 激活约 120B、约 112 层,其中 50% 的层会循环执行一次(looped language model)。他称暂不撰文公开估算方法,但表示有证据支持相关推测,且模拟推演中最常见的取值为 4.5-4.6T。
已确认
- 这些均为 scaling01 个人给出的估计与推测,并非 OpenAI 官方信息;他公开了 4.2T 总参、120B 激活、约 112 层、50% 层循环一次的中心估计
- 他补充:若总参数量小得多(如约 3T),各层可能需循环执行 2-3 次,否则须假设高达 2% 的激活比,而这在实践中难以成立
尚未确认
- 模型的真实参数规模、层数与循环机制均未经 OpenAI 证实,估算方法本身也尚未公开
- 该模型是否为大量专家、低激活率的稀疏 MoE 属于爆料者的进一步推测
为什么重要
- 循环(looped)架构与稀疏 MoE 是当前前沿模型讨论中的热门方向,若 GPT-6 确实采用层循环设计,将意味着以较少参数量换取更深的有效计算深度,对理解下一代模型的Scaling 路线具有参考意义
2026-09-28 ~ 2026-09-28 · 5 条相关
一手来源
- 爆料称 GPT-6 Astra 或为 4.2T 总参 120B 激活的循环架构模型 — scaling01 ·
- scaling01 推测 GPT-6 若仅 3T 参数需循环 2-3 次,否则激活比达 2% — scaling01 ·
- 爆料者模拟推演:GPT-6 Astra 或为 4.2T 参数、120B 激活循环模型 — scaling01 ·
- 【源头】爆料称 GPT-6 Astra 或为 4.2T 总参 120B 激活的循环架构模型 — scaling01 · 2026-09-28
- 【源头】scaling01 推测 GPT-6 若仅 3T 参数需循环 2-3 次,否则激活比达 2% — scaling01 · 2026-09-28