DeepLoop:循环 Transformer 的深度缩放

Shuzhen Li · hf · 2026-07-17

这篇工作讨论 Looped Transformers 的深度缩放问题:当同一组参数被重复访问多次时,残差分支的缩放不能再只看“名义层数”,而要考虑参数被访问的次数。

作者通过一阶扰动界和一个访问对齐系数 κR 形式化这种 tied-depth 效应,并指出:

基于此,方法 DeepLoop 在保持 Post-LN DeepNorm 架构不变的前提下,设定了新的缩放参数:

在 GPT-2 small 和 GPT-2 medium 规模的循环语言模型上,DeepLoop 在没有重复物理块时基本中性;一旦启用递归深度,就能改善验证损失和下游准确率。结论是:稳定的递归深度需要针对“参数访问次数”设计缩放规则,而不只是按层数设定。

所属事件:DeepLoop研究探索循环Transformer深度缩放(2 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →