GEPO 用组熵改造 GRPO,在 13 项基准上更稳更强

internlm · hf · 2026-07-21

### 这项工作做了什么 GEPO 是对 GRPO 的一个轻量扩展,目标是解决 LLM 强化学习里**不同任务组熵分布不一致**的问题。 ### 核心思路 - 在混合任务上做 RL 时,不同 prompt 组往往处于不同的熵区间,单纯做全局或 token 级熵控制不够。 - GEPO 直接利用已有分组样本估计**组熵**,再做**熵条件化的非对称优势塑形**。 - 对低熵组的正优势做衰减,避免过度利用;对高熵组的负优势做保留,维持探索。 - 阈值由历史熵统计自适应给出。 ### 实验结论 作者在两个基础模型、13 个基准上测试,覆盖数学、物理、科学、代码生成和指令跟随。结果显示 GEPO 相比 GRPO 和近期熵控制方法更稳定地带来跨任务提升,同时保持了各任务的探索水平。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →