Two opening tokens lift base model MATH-500 from 42% to 78%, rivaling RL training

arankomatsuzaki · x · 2026-10-06

A paper by Sophie L. Wang, Amil Dravid, et al. (including Alexei Efros) shows base models' reasoning can be elicited without any training:

Related event: Study: Two Opening Tokens Unlock Base Model Reasoning Without RL(4 posts)→

Original post →

More from Models

Models channel →