Stanford's 'relative scaling laws' show LLM scale isn't a universal equalizer

Diyi_Yang · x · 2026-10-07

A COLM 2026 poster by William B. Held, Percy Liang and Diyi Yang introduces relative scaling laws, tracking how performance gaps between test distributions evolve with scale instead of aggregate error. Training 255 decoder-only Transformers under matched-compute IsoFLOP budgets (3×10^18–3×10^20 FLOPs), they find MMLU academic domains converge toward parity, regional English dialects shift with population size, and AI-risk behavior clusters split: capability- and influence-related risks rise during pretraining while adversarial risks don't. Conclusion: scaling improves overall performance but is not a universal equalizer. All checkpoints are released.

Original post →

More from Research

Research channel →