GEPO 用组熵改造 GRPO,在 13 项基准上更稳更强

internlm · hf · 2026-07-21

这项工作做了什么

GEPO 是对 GRPO 的一个轻量扩展,目标是解决 LLM 强化学习里不同任务组熵分布不一致的问题。

核心思路

实验结论

作者在两个基础模型、13 个基准上测试,覆盖数学、物理、科学、代码生成和指令跟随。结果显示 GEPO 相比 GRPO 和近期熵控制方法更稳定地带来跨任务提升,同时保持了各任务的探索水平。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →