PUST: New Paradigm Uses Small Models to Guide Large Model Training
A new post-training paradigm named PUST decouples exploration from distribution alignment by using small proxy models to explore and transfer update signals, reducing the high costs of reinforcement learning for large models.
2026-07-14 ~ 2026-07-15 · 2 related posts
- PUST: Transferring Update Signals via Proxy Models — KnowledgeXLab · 2026-07-14
- Small Models Explore First to Guide Large Models — burny_tech · 2026-07-15