Pretraining efficiency gains come mostly from data, but end-to-end task gains spread across RL and systems

eigenron · x · 2026-10-10

eigenron cites Dwarkesh's recent experiments to argue that most compute-efficiency gains in pretraining have come from better data rather than model architecture improvements. However, for actual end-to-end task performance, the gains are much more evenly distributed between RL, systems/engineering, and data, rather than being overwhelmingly data-driven.

Original post →

More from Research

Research channel →