Paper: Long-Horizon Agents Need Strong Pre-training and OPD

rohanpaul_ai · x · 2026-08-25

Addressing poor reliability in long-horizon agents, a new paper argues that post-training alone cannot fix weak foundations due to noisy trajectory error compounding. It proposes using clean world-models during pre-training and On-Policy Distillation (OPD) for post-training when rewards are sparse. Experiments show OPD handles long, noisy settings better than outcome-reward GRPO.

Original post →

More from coding & agent

coding & agent channel →