GEPO 用组熵改造 GRPO,在 13 项基准上更稳更强
internlm · hf · 2026-07-21
这项工作做了什么
GEPO 是对 GRPO 的一个轻量扩展,目标是解决 LLM 强化学习里不同任务组熵分布不一致的问题。
核心思路
- 在混合任务上做 RL 时,不同 prompt 组往往处于不同的熵区间,单纯做全局或 token 级熵控制不够。
- GEPO 直接利用已有分组样本估计组熵,再做熵条件化的非对称优势塑形。
- 对低熵组的正优势做衰减,避免过度利用;对高熵组的负优势做保留,维持探索。
- 阈值由历史熵统计自适应给出。
实验结论
作者在两个基础模型、13 个基准上测试,覆盖数学、物理、科学、代码生成和指令跟随。结果显示 GEPO 相比 GRPO 和近期熵控制方法更稳定地带来跨任务提升,同时保持了各任务的探索水平。
「研究」频道最新
- Nature 新研究实现全身器官细胞活动成像,揭示跨器官体级回路 — arjunrajlab · 2026-09-11
- SignNet 1M 手语数据集发布 — ducha_aiki · 2026-09-11
- ECCV26 口头论文:流匹配实现多视角点云配准 — ducha_aiki · 2026-09-11
- InFlux++ 方法发布 — ducha_aiki · 2026-09-11
- Skyfall GS 登场:用 Flux 提升 Gaussian Splatting 精修质量 — ducha_aiki · 2026-09-11
- 一万个智能体能否突破反向传播,找到更好的学习算法 — SeunghyunSEO7 · 2026-09-11