阿里提出 ERPO:用环境正则化优化 LLM 策略
alibabagroup · hf · 2026-08-25
阿里巴巴团队发布论文《Beyond the Stability-Exploration Dilemma》,提出 ERPO(Environmental Regularization for Policy Optimization)。该方法通过输入端的查询分布控制替代动作端的策略正则化,旨在稳定语言模型的强化学习过程,同时保持响应探索能力,解决传统 RL 中稳定性与探索性难以兼顾的困境。
「研究」频道最新
- Statistical Rethinking 2026 课程发布:20 讲涵盖因果推断与科学建模 — RichmanRonald · 2026-08-25
- 模拟推理新范式:用神经网络解概率黑箱 — burkov · 2026-08-25
- 科学数据压缩新法 WIEN-INR,保留微小物理结构 — bravo_abad · 2026-08-25
- NeurIPS 2026 征稿:关注 AI 在生物学中的失效模式 — anshulkundaje · 2026-08-25
- SimCLR 与 MoCo 区别于增量式科学 — 3scorciav · 2026-08-25
- 换了研究方向后,如何快速摸清一个领域五年的脉络 — LumilitawNaMangga · 2026-08-25