递归深度循环训练改善 scaling 指数,7.4B 模型省 20 倍算力匹敌 GPT-3 13B
andrewgwils · x · 2026-09-17
Andrew Wilson 等人的新论文表明,在预训练中用「循环/looping」递归加深模型,可以提升 scaling 指数本身,而不只是改常数——这意味着随算力增长而放大的效率收益,挑战了「只有数据干预能改 scaling 指数」的传统认知。
- 方法:训练过程中增加循环次数让模型深度随训练增长(权重分 tied 与 untied 两种),另测试一个简单 boundary operator,对残差流做归一化并注入更早的 block。
- 效果:7.4B 的 model-growth 架构在 CORE 指标上以约 1/20 的算力匹敌 GPT-3 13B。
- 动机:直觉是任意算力预算下都应让 transformer 的有效深度尽量大,因为「深度诅咒」常使后面的 block 贡献趋近于零。
- 多 epoch 训练下,标准 looping 也是算力最优的,最优循环数随算力预算增加,looping 具有正则化作用;单/多 epoch 中有效深度都是关键因素。
所属事件:循环深度改写 scaling 指数,7.4B 模型省 20 倍算力(4 条相关)→
「模型」频道最新
- 曝 OpenAI 用代号 Doug 的新模型逼近破解千禧年大奖难题 Hodge 猜想 — kimmonismus · 2026-09-18
- GPT-6 Astra 机器人控制基准碾压 Claude Fable 5.1:成功率 35% 对 15% — k7agar · 2026-09-18
- 曝 OpenAI 用下一代模型「Doug」逼近破解千禧年大奖难题 Hodge 猜想 — kimmonismus · 2026-09-18
- 研究尝试:48 头注意力校准压缩到 12 头,其余换带状稀疏注意力 — ostrisai · 2026-09-18
- 曝 Grok 4.7 全新预训练:2.1T 参数,整体超越 4.6 — airesearch12 · 2026-09-18
- 跑完 20 亿 tokens 后他砍掉九成 AI 开销:月费从 $300 降到 $30 — gaganghotra_ · 2026-09-18