GEPO 用组熵改造 GRPO,在 13 项基准上更稳更强
internlm · hf · 2026-07-21
### 这项工作做了什么 GEPO 是对 GRPO 的一个轻量扩展,目标是解决 LLM 强化学习里**不同任务组熵分布不一致**的问题。 ### 核心思路 - 在混合任务上做 RL 时,不同 prompt 组往往处于不同的熵区间,单纯做全局或 token 级熵控制不够。 - GEPO 直接利用已有分组样本估计**组熵**,再做**熵条件化的非对称优势塑形**。 - 对低熵组的正优势做衰减,避免过度利用;对高熵组的负优势做保留,维持探索。 - 阈值由历史熵统计自适应给出。 ### 实验结论 作者在两个基础模型、13 个基准上测试,覆盖数学、物理、科学、代码生成和指令跟随。结果显示 GEPO 相比 GRPO 和近期熵控制方法更稳定地带来跨任务提升,同时保持了各任务的探索水平。
「研究」频道最新
- LTX 2.3 LoRA 演示可直接改视频镜头角度 — CQDSN · 2026-07-21
- OpenForecaster 用每日新闻提升语言模型预测能力 — Cohere_Labs · 2026-07-21
- 商汤在 WAIC 2026 推出 U1 Pro 并开源 5000 万样本视觉数据集 — 机器之心 · 2026-07-21
- Baseten 研究发现,LLM 新事实写入权重后很脆弱 — alex_verem · 2026-07-21
- Kimi K3 与 Fable 5 的差距已不像过去那样明显 — FinanceYF5 · 2026-07-21
- uv-scripts/ocr重回HF热门榜并新增JSON模型选择目录 — vanstriendaniel · 2026-07-21