港科大提出 CorrGRPO:用相关系数归一化解多奖励训练失衡
HKUST · hf · 2026-10-02
港科大提出 CorrGRPO,改进推理模型常用的 GRPO 多奖励训练。原方法把各奖励求和后按组内标准差归一化,当某些奖励尺度大时,会因协方差主导归一化而压制小尺度奖励的信号。
CorrGRPO 将成对协方差归一化为 Pearson 相关系数,保持中心化总奖励不变的同时,让优势幅度自适应奖励相关性,不被大尺度奖励支配。在 0.5B 到 8B 参数模型上,于代码生成、工具调用、agent 安全三个多奖励任务中均超过 GRPO 及其变体。代码开源于 GitHub。
「研究」频道最新
- Looped Transformers 成研究新热,Kye Gomez 称早被自己押中 — KyeGomezB · 2026-10-02
- INRIA 用最优传输联合重定向人机物体动作,G1 真机验证交互 Jaccard 达 87% — INRIA · 2026-10-02
- 开发者开源个人助手决策模型 CalDec,小数据微调逼近闭源 — No_Contract_8296 · 2026-10-02
- OpenAI 安全研究 VP 翁荔公开博客写作七步法 — SinclairWang1 · 2026-10-02
- Arena.ai 发布 HarnessTax:编码 Agent 的 harness 到底影响多大 — solyarisoftware · 2026-10-02
- 伯克利论文:LLM 记得你的新指令却仍用旧选择 — rohanpaul_ai · 2026-10-02