Diffusion Reward Models:让奖励模型学习人类偏好分布而非单一分数

burny_tech · x · 2026-09-30

团队提出 Diffusion Reward Models(DRM),挑战 LLM 后训练中奖励模型的主流假设:传统 RM 把人类偏好压缩为单一标量分数,但人类反馈往往不是点估计——不同人对同一回答可能有明显分歧甚至冲突。DRM 尝试让奖励模型学习人类偏好的分布而非单点,以保留偏好数据的多样性信号。论文、代码与模型均已开源。

所属事件:清华团队推出扩散奖励模型,重构人类偏好建模(2 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →