论文揭示 GRPO 梯度冲突隐忧,提贝叶斯优化方案

kastnerkyle · x · 2026-08-31

该帖讨论了一篇新 arXiv 论文,指出了在推理模型后训练中广泛使用的 GRPO(Group Relative Policy Optimization)存在的一个隐缺陷:传统 GRPO 假设批次内所有查询的梯度同样可靠,并直接进行确定性平均。实际上,同一批次内不同查询的梯度方向常互相冲突,导致平均后的更新向量被“稀释”,效果低效。论文提出不应将组梯度视为固定向量,而应将其建模为贝叶斯框架下的随机变量,并利用基于狄利克雷分布的公式来捕捉梯度分布,从而优化更新过程。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →