循环深度改写 scaling 指数,7.4B 模型省 20 倍算力

Andrew Gordon Wilson 团队发布新论文,挑战「架构干预只能带来常数因子增益」的传统认知。研究发现通过模型生长与循环加深(looping)修改递归深度,可以改善预训练的 scaling 指数本身,使算力效率增益随规模增大而指数级放大。实验显示 7.4B 参数的循环模型可节省约 20 倍算力,性能匹敌 GPT-3 13B。

2026-09-17 ~ 2026-09-17 · 4 条相关

另有 1 条近重复转述:andrewgwils