DeepLoop:循环 Transformer 的深度缩放
Shuzhen Li · hf · 2026-07-17
这篇工作讨论 Looped Transformers 的深度缩放问题:当同一组参数被重复访问多次时,残差分支的缩放不能再只看“名义层数”,而要考虑参数被访问的次数。
作者通过一阶扰动界和一个访问对齐系数 κR 形式化这种 tied-depth 效应,并指出:
- 在访问去相关时,结论可回到 DeepNorm 风格的指数
- 在保守、强对齐的情况下,随着循环次数增加、物理深度固定,指数需要从 1/4 提升到 1/2
基于此,方法 DeepLoop 在保持 Post-LN DeepNorm 架构不变的前提下,设定了新的缩放参数:
- α = (2N)^{1/2}
- β = (8N)^{-1/2}
在 GPT-2 small 和 GPT-2 medium 规模的循环语言模型上,DeepLoop 在没有重复物理块时基本中性;一旦启用递归深度,就能改善验证损失和下游准确率。结论是:稳定的递归深度需要针对“参数访问次数”设计缩放规则,而不只是按层数设定。
所属事件:DeepLoop研究探索循环Transformer深度缩放(2 条相关)→
「研究」频道最新
- researchers 辩论双向注意力:检索微调放大后因果性或可舍弃 — antoine_chaffin · 2026-09-11
- HF 工程师争论:非生成任务全用因果注意力是在浪费算力 — antoine_chaffin · 2026-09-11
- 智利学者:AI 反馈规模化是医学教育可持续的关键 — julianvarascom · 2026-09-11
- Nature 新研究实现全身器官细胞活动成像,揭示跨器官体级回路 — arjunrajlab · 2026-09-11
- SignNet 1M 手语数据集发布 — ducha_aiki · 2026-09-11
- ECCV26 口头论文:流匹配实现多视角点云配准 — ducha_aiki · 2026-09-11