清华团队推出扩散奖励模型,重构人类偏好建模

清华 NLP 团队提出 Diffusion Reward Models(DRM),挑战 LLM 后训练中奖励模型的主流假设。传统奖励模型将人类偏好压缩为单一标量分数,但人类反馈往往并非点估计,而是具有天然的多峰结构。DRM 将奖励建模从点估计改为对 p(r|x,y) 的条件密度估计,从而更完整地刻画人类偏好分布。

2026-09-29 ~ 2026-09-30 · 2 条相关