递归深度循环训练改善 scaling 指数,7.4B 模型省 20 倍算力匹敌 GPT-3 13B

andrewgwils · x · 2026-09-17

Andrew Wilson 等人的新论文表明,在预训练中用「循环/looping」递归加深模型,可以提升 scaling 指数本身,而不只是改常数——这意味着随算力增长而放大的效率收益,挑战了「只有数据干预能改 scaling 指数」的传统认知。

所属事件:循环深度改写 scaling 指数,7.4B 模型省 20 倍算力(4 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →