The Depth Delusion: Why Transformers Should Be Wider, Not Deeper
Md Muhtasim Munif Fahim, Md Rezaul Karim
cs.LG, cs.AI
2026-01-29
扫过 30 个从 1700 万到 70 亿参数的 Transformer 后,临界深度按宽度的 0.44 次幂涨;7B 上 32 层宽模型损失 2.298,64 层窄模型 2.417,更深更窄的一侧高出 0.12 nats。
Kaplan 和 Chinchilla 把语言模型损失写成参数量 N 和 token 数 T 的幂律,默认同一堆参数怎么摆都差不多。10 层×8192 维和 80 层×2048 维,只要总数接近,公式给出的损失一样。业界实际偏好更深:GPT-3 96 层,PaLM 118 层,理由通常是深度带来组合推理。
孟加拉 Rajshahi 大学的这篇打的就是这个假设。他们把损失拆成容量项、数据项,再加一项只跟深度和宽度有关的结构惩罚,并声称超过临界深度后再加层,损失会升。他们把这种现象叫做 Depth Delusion。
核心观察是梯度在层间指数衰减,持久长度 τ(W)∝W^0.44(拟合 R²=0.98)。临界深度 Dcrit 取底层梯度掉到顶层 1/e 的位置,于是 Dcrit∝W^0.44;实验范围内也可以用 2.43 ln W 近似。宽度 512 时 Dcrit≈15。
超过 Dcrit 的多余层贡献一项惩罚 Φ,随超出比例线性涨,宽度越大惩罚越弱。在算力 C=6NT 约束下最小化,得到 D∝C^0.12、W∝C^0.34,宽度的缩放指数大约是深度的 2.8 倍。这组 0.12 / 0.34 用的是 Kaplan 的 α≈0.076,不是他们自己拟合出来的 α=0.22。
实验是 30 个 decoder-only Transformer,深度 2–80,宽度 256–6144,参数从 2700 万到 71 亿。Pre-LN、RoPE、GELU,无 dropout。数据用 SlimPajama。小模型扫 64 亿 token;1B–7B 最多训到 1400 亿 token。AdamW,峰值学习率 3×10^{-4},全局种子固定为 42。算力来自 Google TPU Research Cloud。
全量拟合 R²=0.922,RMSE=0.113 nats。固定宽度 512 时,深度呈 U 型:
| 结构 | 参数 | 损失 |
| 16L×512W | 102.1M | 3.435 |
| 24L×512W | 127.3M (+25%) | 3.468 |
| 32L×512W | 152.4M (+50%) | 3.441 |
24 层比 16 层多 25% 参数,损失高 0.033 nats。32 层略好于 24 层,仍不如 16 层。固定 16 层把宽度从 256 拉到 1536,损失从 3.929 单调降到 3.049,没有对称的「宽度幻觉」。
大尺度同样是浅宽赢:
| 尺度 | 较优配置 / 损失 | 过深配置 / 损失 | ΔL |
| 1B | 24L/1792, 2.821 | 80L/1024, 2.978 | +0.16 |
| 3B | 40L/2432, 2.519 | 72L/1792, 2.681 | +0.16 |
| 7B | 32L/4096, 2.298 | 64L/2816, 2.417 | +0.12 |
7B 上 32 层×4096(6.86B 参数)损失 2.298,64 层×2816(6.38B)损失 2.417。更深更窄的那个参数还少 4.8 亿,FLOPs 也略低(5.30×10^{21} vs 5.89×10^{21})。这组对比说明同样量级下深窄不如浅宽;「加了参数损失反而升」的干净证据,仍是宽度 512 那张表。
他们用 κ=2.43 外推:GPT-3 的 Dcrit≈22.9,实际 96 层;PaLM ≈23.9 vs 118;Llama-3 70B ≈21.9 vs 80。比值 3.6–4.9 倍。这是外推,不是实验。
如果临界深度真按宽度的 0.44 次幂涨,堆层数就不是免费的表达力。早期层付了参数和算力,梯度却弱到学不动。Mistral 7B 用 32 层,和这篇 7B 最优点碰巧一致。对要新开预训练的人,文中给的启发式是不要超过 D≈2.5 ln W,优先加宽。
它挑战的是 Kaplan 那句「损失只看 N 不看形状」。7B 以内有对照,100B 以上还没有。
自己拟合的容量指数 α=0.22,95% 置信区间是 [-0.21, 0.65],把 0 包进去了,最优缩放那条推论并不稳。最优指数还是借 Kaplan 的 α,和自己的拟合对不上。
全部单种子。小模型只有 64 亿 token,7B 那组也不是严格等参数、等 FLOP。ReZero、DeepNet、NormFormer 这类稳深度的技巧都没试,Pre-LN 上量到的临界深度,可能被这些方法往上推。只有网页文本自回归,代码或图像未必同一套 κ。用 2.43 ln W 去判 GPT-3 / PaLM 过深,跨越了两个数量级。