新论文:模型增长+循环训练可改写 scaling 律,省 20 倍算力追平 GPT-3

burny_tech · x · 2026-09-19

industriaalist 团队发布新论文,挑战「架构改动只能带来常数级收益、预训练进步主要靠数据」的普遍假设,展示了模型增长(looping with model growth)能持续改进 scaling 指数,带来随算力指数级放大的收益:

Steve Hsu 转发评论:如果有效计算深度是决定 scaling 指数的关键,那么一个能检查自身残差流、发现后期层贡献消失、并在训练中途提出加循环与新边界算子的模型,已经算是在做狭义的递归自我改进(narrow RSI)——这种改动代码量小、可小规模验证,且每轮循环既提升模型发明下一步修改的能力,又放大验证算力的回报,形成复利循环。他还将其与 DeepSeek 的 mHC(把残差流扩展为并行流、用 Birkhoff 多胞体上的双随机矩阵做投影)相提并论。

所属事件:循环深度改写 scaling 指数:7.4B 模型省 20 倍算力匹敌 GPT-3 13B(6 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →