循环深度改写 scaling 指数,7.4B 模型省 20 倍算力
Andrew Gordon Wilson 团队发布新论文,挑战「架构干预只能带来常数因子增益」的传统认知。研究发现通过模型生长与循环加深(looping)修改递归深度,可以改善预训练的 scaling 指数本身,使算力效率增益随规模增大而指数级放大。实验显示 7.4B 参数的循环模型可节省约 20 倍算力,性能匹敌 GPT-3 13B。
2026-09-17 ~ 2026-09-17 · 4 条相关
- 新论文称循环加模型生长可弯折缩放律,算力收益随规模指数放大 — akbirthko · 2026-09-17
- 循环深度改写 scaling 指数:7.4B 模型省 20 倍算力匹敌 GPT-3 13B — andrewgwils · 2026-09-17
- 新论文:修改递归深度可提升预训练 scaling 指数,越大规模越省算力 — bo_wangbo · 2026-09-17
另有 1 条近重复转述:andrewgwils