临界深度随宽度亚线性涨,7B 上 64 层比 32 层差 0.12 nats

The Depth Delusion: Why Transformers Should Be Wider, Not Deeper

Md Muhtasim Munif Fahim, Md Rezaul Karim

cs.LG, cs.AI

2026-01-29

扫过 30 个从 1700 万到 70 亿参数的 Transformer 后,临界深度按宽度的 0.44 次幂涨;7B 上 32 层宽模型损失 2.298,64 层窄模型 2.417,更深更窄的一侧高出 0.12 nats。

这篇在解决什么

Kaplan 和 Chinchilla 把语言模型损失写成参数量 N 和 token 数 T 的幂律,默认同一堆参数怎么摆都差不多。10 层×8192 维和 80 层×2048 维,只要总数接近,公式给出的损失一样。业界实际偏好更深:GPT-3 96 层,PaLM 118 层,理由通常是深度带来组合推理。

孟加拉 Rajshahi 大学的这篇打的就是这个假设。他们把损失拆成容量项、数据项,再加一项只跟深度和宽度有关的结构惩罚,并声称超过临界深度后再加层,损失会升。他们把这种现象叫做 Depth Delusion。

方法

核心观察是梯度在层间指数衰减,持久长度 τ(W)∝W^0.44(拟合 R²=0.98)。临界深度 Dcrit 取底层梯度掉到顶层 1/e 的位置,于是 Dcrit∝W^0.44;实验范围内也可以用 2.43 ln W 近似。宽度 512 时 Dcrit≈15。

超过 Dcrit 的多余层贡献一项惩罚 Φ,随超出比例线性涨,宽度越大惩罚越弱。在算力 C=6NT 约束下最小化,得到 D∝C^0.12、W∝C^0.34,宽度的缩放指数大约是深度的 2.8 倍。这组 0.12 / 0.34 用的是 Kaplan 的 α≈0.076,不是他们自己拟合出来的 α=0.22。

实验是 30 个 decoder-only Transformer,深度 2–80,宽度 256–6144,参数从 2700 万到 71 亿。Pre-LN、RoPE、GELU,无 dropout。数据用 SlimPajama。小模型扫 64 亿 token;1B–7B 最多训到 1400 亿 token。AdamW,峰值学习率 3×10^{-4},全局种子固定为 42。算力来自 Google TPU Research Cloud。

结果

全量拟合 R²=0.922,RMSE=0.113 nats。固定宽度 512 时,深度呈 U 型:

结构参数损失
16L×512W102.1M3.435
24L×512W127.3M (+25%)3.468
32L×512W152.4M (+50%)3.441

24 层比 16 层多 25% 参数,损失高 0.033 nats。32 层略好于 24 层,仍不如 16 层。固定 16 层把宽度从 256 拉到 1536,损失从 3.929 单调降到 3.049,没有对称的「宽度幻觉」。

大尺度同样是浅宽赢:

尺度较优配置 / 损失过深配置 / 损失ΔL
1B24L/1792, 2.82180L/1024, 2.978+0.16
3B40L/2432, 2.51972L/1792, 2.681+0.16
7B32L/4096, 2.29864L/2816, 2.417+0.12

7B 上 32 层×4096(6.86B 参数)损失 2.298,64 层×2816(6.38B)损失 2.417。更深更窄的那个参数还少 4.8 亿,FLOPs 也略低(5.30×10^{21} vs 5.89×10^{21})。这组对比说明同样量级下深窄不如浅宽;「加了参数损失反而升」的干净证据,仍是宽度 512 那张表。

他们用 κ=2.43 外推:GPT-3 的 Dcrit≈22.9,实际 96 层;PaLM ≈23.9 vs 118;Llama-3 70B ≈21.9 vs 80。比值 3.6–4.9 倍。这是外推,不是实验。

为什么重要

如果临界深度真按宽度的 0.44 次幂涨,堆层数就不是免费的表达力。早期层付了参数和算力,梯度却弱到学不动。Mistral 7B 用 32 层,和这篇 7B 最优点碰巧一致。对要新开预训练的人,文中给的启发式是不要超过 D≈2.5 ln W,优先加宽。

它挑战的是 Kaplan 那句「损失只看 N 不看形状」。7B 以内有对照,100B 以上还没有。

局限与存疑

自己拟合的容量指数 α=0.22,95% 置信区间是 [-0.21, 0.65],把 0 包进去了,最优缩放那条推论并不稳。最优指数还是借 Kaplan 的 α,和自己的拟合对不上。

全部单种子。小模型只有 64 亿 token,7B 那组也不是严格等参数、等 FLOP。ReZero、DeepNet、NormFormer 这类稳深度的技巧都没试,Pre-LN 上量到的临界深度,可能被这些方法往上推。只有网页文本自回归,代码或图像未必同一套 κ。用 2.43 ln W 去判 GPT-3 / PaLM 过深,跨越了两个数量级。

术语

原文与代码

社区讨论

相关论文

全部论文解读