Treating RL as a Learned Optimizer: Exploring Multi-Start Restart Strategies

YouJiacheng · x · 2026-08-04

Developer YouJiacheng discussed a new perspective on XM (likely referring to an RL/optimization algorithm): treating it as a learned optimizer.

He noted that using restart or multi-start strategies is a well-known practice in non-convex optimization, dating back to a 1982 paper. Consequently, it makes sense to train a learned optimizer with restart mechanisms. However, he also highlighted an unresolved challenge: how to effectively resolve the train-test mismatch from this perspective.

Related event: New Perspective on Model Training: Multi-Start Restart Strategies(3 posts)→

Original post →

More from Research

Research channel →