分析称 OpenAI 若在 Astra 上用 Looped Transformer,必已验证可扩展

teortaxesTex · x · 2026-09-03

stalkermustang 讨论了 Looped Transformer 研究与 OpenAI 疑似新模型 Astra 的关系。他承认 open research 与 OpenAI 内部研究未必相同,但指出:如果 Looped 架构真的用在一个总参数量超 3T、比任何开源模型都大的 Astra 上,意味着 OpenAI 已经做过大量消融和 scaling 研究,不太可能没验证就投入超过 1 亿美元。

因此结论是 Looped 架构应该确实能 scale——即便 pretraining loss 不占优,downstream 任务表现大概率会更好,甚至两者都占优。

引用的对比实验显示 loop 的代价:在固定训练 FLOPs 下,355M 参数的 Looped GPT(1 epoch, K=4)输给训练 2 epochs 的 vanilla GPT,说明 looping 在同算力下可能吃亏,这或许正是需要大规模验证的原因。

所属事件:传OpenAI新模型Astra采用循环深度架构(11 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →