清华 NLP 提出扩散奖励模型 DRM:把奖励建模改成条件密度估计

TsinghuaNLP · hf · 2026-09-29

清华 NLP 团队发布 DRM(Diffusion Reward Model),将奖励建模从点估计改为对 p(r|x,y) 的条件密度估计,以刻画人类偏好的天然多峰结构。

所属事件:清华团队推出扩散奖励模型,重构人类偏好建模(2 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →