Princeton-Stanford study: optimizer rankings flip with batch size; best scaling rule is setting-dependent

xingyudang · x · 2026-10-10

A new paper and interactive blog by Xingyu Dang (Princeton), Kaiyue Wen (Stanford), and Sadhika Malladi (UCSD) systematically studies how batch size interacts with learning-rate scaling rules and optimizer choice:

An interactive blog lets readers change batch size to watch rankings flip and test their own scaling rules.

Related event: Study: Optimal Optimizer Varies With Batch Size, Rankings Can Flip(2 posts)→

Original post →