港科大提出 CorrGRPO:用相关系数归一化解多奖励训练失衡

HKUST · hf · 2026-10-02

港科大提出 CorrGRPO,改进推理模型常用的 GRPO 多奖励训练。原方法把各奖励求和后按组内标准差归一化,当某些奖励尺度大时,会因协方差主导归一化而压制小尺度奖励的信号。

CorrGRPO 将成对协方差归一化为 Pearson 相关系数,保持中心化总奖励不变的同时,让优势幅度自适应奖励相关性,不被大尺度奖励支配。在 0.5B 到 8B 参数模型上,于代码生成、工具调用、agent 安全三个多奖励任务中均超过 GRPO 及其变体。代码开源于 GitHub。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →