Alibaba Proposes ERPO: Environmental Regularization for Stable LLM RLHF

alibabagroup · hf · 2026-08-25

Alibaba Group published the paper 'Beyond the Stability-Exploration Dilemma', introducing ERPO (Environmental Regularization for Policy Optimization). ERPO replaces action-side policy regularization with input-side query distribution control to stabilize reinforcement learning for language models while preserving response exploration, addressing the trade-off between stability and exploration.

Original post →

More from Research

Research channel →