分析称 OpenAI 若在 Astra 上用 Looped Transformer,必已验证可扩展
teortaxesTex · x · 2026-09-03
stalkermustang 讨论了 Looped Transformer 研究与 OpenAI 疑似新模型 Astra 的关系。他承认 open research 与 OpenAI 内部研究未必相同,但指出:如果 Looped 架构真的用在一个总参数量超 3T、比任何开源模型都大的 Astra 上,意味着 OpenAI 已经做过大量消融和 scaling 研究,不太可能没验证就投入超过 1 亿美元。
因此结论是 Looped 架构应该确实能 scale——即便 pretraining loss 不占优,downstream 任务表现大概率会更好,甚至两者都占优。
引用的对比实验显示 loop 的代价:在固定训练 FLOPs 下,355M 参数的 Looped GPT(1 epoch, K=4)输给训练 2 epochs 的 vanilla GPT,说明 looping 在同算力下可能吃亏,这或许正是需要大规模验证的原因。
所属事件:传OpenAI新模型Astra采用循环深度架构(11 条相关)→
「模型」频道最新
- antirez:steering 有失真,能归零就归零 — antirez · 2026-09-03
- antirez 开源 DS4F steering 向量:可调强度绕过拒答 — antirez · 2026-09-03
- OpenAI 新模型 Astra 被质疑迈向「neuralese」滑坡 — ShakeelHashim · 2026-09-03
- 开发者质疑 Meta Muse Spark 1.3 仅在跑分上好看,基准被严重操纵 — bindureddy · 2026-09-03
- HUMAIN 发布阿拉伯语前沿模型 HUMAIN-M3,MiniMax 操刀开发 — HUMAIN · 2026-09-03
- 一句话去掉 Claude 腔:提示词写 Remove all mannered prose — daniel_mac8 · 2026-09-03