DeepLoop:循环 Transformer 的深度缩放
Shuzhen Li · hf · 2026-07-17
这篇工作讨论 **Looped Transformers** 的深度缩放问题:当同一组参数被重复访问多次时,残差分支的缩放不能再只看“名义层数”,而要考虑参数被访问的次数。 作者通过一阶扰动界和一个访问对齐系数 **κ_R** 形式化这种 tied-depth 效应,并指出: - 在访问去相关时,结论可回到 DeepNorm 风格的指数 - 在保守、强对齐的情况下,随着循环次数增加、物理深度固定,指数需要从 **1/4** 提升到 **1/2** 基于此,方法 **DeepLoop** 在保持 Post-LN DeepNorm 架构不变的前提下,设定了新的缩放参数: - **α = (2N)^{1/2}** - **β = (8N)^{-1/2}** 在 GPT-2 small 和 GPT-2 medium 规模的循环语言模型上,DeepLoop 在没有重复物理块时基本中性;一旦启用递归深度,就能改善验证损失和下游准确率。结论是:稳定的递归深度需要针对“参数访问次数”设计缩放规则,而不只是按层数设定。
所属事件:DeepLoop研究探索循环Transformer深度缩放(2 条相关)→
「研究」频道最新
- 把数据集打包成顺序 blob,训练吞吐提升 30% — irinarish · 2026-07-21
- UIUC 提出 AgentPrimitives:多智能体的可复用潜在积木 — 机器之心 · 2026-07-21
- 一个 C++20 CPU 原生 strict-W1 训练 runtime 寻求反馈 — Wonderful-Income7415 · 2026-07-21
- 微软提出像训练神经网络一样训练 agent 技能 — Saboo_Shubham_ · 2026-07-21
- 研究者:AI 应是放大器,而不是放弃科研的理由 — omarsar0 · 2026-07-21
- 海森矩阵入门:二阶导数如何影响神经网络优化 — burny_tech · 2026-07-21