'Depth Delusion' paper: Transformers should scale width 2.8x faster than depth

xuanalogue · x · 2026-09-04

A new arXiv paper proposes architecture-conditioned scaling laws: optimal depth scales as DC^0.12 while optimal width scales as WC^0.34 — width should grow 2.8x faster. Beyond a critical depth DcritW^0.44, adding layers increases loss despite more parameters. Validated across 30 transformer architectures (17M–7B params, R²=0.922); at 7B scale, a 64-layer 6.38B model underperforms a 32-layer 6.86B model by 0.12 nats. Deeper isn't better at production scale.

Original post →

More from Research

Research channel →