Pretraining progress is mostly from data: 12x compute gains from data vs 3.7x from models

sebkrier · x · 2026-09-09

Original post →

More from Research

Research channel →