Morgan Stanley's Parallel Power Tempering sampling rivals RL post-training without weight updates

morganstanley · hf · 2026-10-02

Morgan Stanley researchers introduce Parallel Power Tempering (PPT), an inference-time alternative to RL post-training: multiple interacting replicas at different power-sharpening levels let low-power chains explore diverse reasoning while high-power chains exploit high-likelihood answers. PPT also fixes a truncation bias in prior power samplers. In extensive experiments it beats single-chain power sampling, outperforms RL-post-trained models, and produces reasoning traces comparable to frontier models — with no parameter updates or external rewards.

Original post →

More from Models

Models channel →