阿里提出 ERPO:用环境正则化优化 LLM 策略

alibabagroup · hf · 2026-08-25

阿里巴巴团队发布论文《Beyond the Stability-Exploration Dilemma》,提出 ERPO(Environmental Regularization for Policy Optimization)。该方法通过输入端的查询分布控制替代动作端的策略正则化,旨在稳定语言模型的强化学习过程,同时保持响应探索能力,解决传统 RL 中稳定性与探索性难以兼顾的困境。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →