传 GPT-6 Astra 采用循环 Transformer:加深计算层数而非堆参数量
pranavmarla · x · 2026-09-16
SemiAnalysis 相关讨论被引用称,GPT-6 Astra(未经官方证实)据称使用 loop transformer 架构:模型不再增大参数量,而是让同样的权重多次穿过层,以增加计算深度换取能力提升。
- 核心含义:如果"深度胜过规模"成立,以 FLOP 数量为核心的算力军备竞赛格局将改变——权重复用使推理成本曲线与常规 scaling 完全不同。
- 转发者观点:实验室在路线图中不再激进堆参数,说明他们自己的研究已发现参数规模扩张回报有限,而实验室正是最清楚 scaling 走向的一方。
- 注意:该说法属圈内爆料/转述,官方尚未确认。
所属事件:爆料称 GPT-6 Astra 采用循环 Transformer 架构(3 条相关)→
「Infra」频道最新
- 单机双模型同跑:Qwen 27B 与 DeepSeek 共享一台异构设备 — QuixiAI · 2026-09-16
- 本地跑大模型工具盘点:vLLM、Unsloth 等推理与训练利器 — thisdudelikesAI · 2026-09-16
- Unsloth 推出桌面应用:本地运行和训练 LLM 一站搞定 — thisdudelikesAI · 2026-09-16
- GPU 算力是金融工程问题:拆解 AI 实验室 80% 毛利与扩容经济学 — sarahdrinkwater · 2026-09-16
- 德国算力困局:黑森州电力需求或增三倍,DFKI研发省电AI — FlorianGallwitz · 2026-09-16
- Novita 开源 Chord W4A16 MoE 内核,Kimi K2.x 推理最高提速 2.15x — vllm_project · 2026-09-16