爆料称 GPT-6 Astra 用循环 Transformer:加深度不加参数
zephyr_z9 · x · 2026-09-15
SemiAnalysis 转述称,GPT-6 Astra 基本确认采用「loop transformer」架构:不再靠增加参数量做大模型,而是让模型多次通过同一组层,用计算深度换模型规模。
文中判断:实验室既然最清楚 scaling 该往哪走,这条路线意味着大厂在路线图上已不再激进堆参数,参数规模扩张放缓是重要信号。
「模型」频道最新
- 用户实测 grok-4.6 一次代码审查 14 分钟耗掉 40% 配额 — bytebot · 2026-09-15
- Minds 用开源模型顶替前沿能力,Animoca 算力成本降约 20 倍 — MiniMax_AI · 2026-09-15
- 两天与 Fable 5.1 共研神经科学:科研能力强但难越已知边界 — generativist · 2026-09-15
- 机器 jer 的代码人类已读不懂:「machineslop」与奖励劫持 — jiqizhixin · 2026-09-15
- 有人 $200 订阅 30 天跑出 $1 万用量,也有人 API 13 小时烧掉 $1200 — kfountou · 2026-09-15
- 蚂蚁 inclusionAI 开源 LLaDA-UI:167 亿参数扩散式 GUI Agent — inclusionAI · 2026-09-15