清华 NLP 提出扩散奖励模型 DRM:把奖励建模改成条件密度估计
TsinghuaNLP · hf · 2026-09-29
清华 NLP 团队发布 DRM(Diffusion Reward Model),将奖励建模从点估计改为对 p(r|x,y) 的条件密度估计,以刻画人类偏好的天然多峰结构。
- 架构:在冻结 LLM 编码器条件下,一个轻量 Diffusion Transformer 将高斯噪声去噪为奖励向量,不对输出分布做参数化假设;同一架构同时支持多属性回归与成对偏好数据。推理时采样 N 次构成经验奖励分布,可聚合为标量、方差或分位数。
- 结果:同数据同骨干下,DRM 在五个基准上持平或超过基线,以较小的训练规模与大得多的判别式/分布式/生成式 RM 竞争力相当;能恢复传统奖励头坍缩掉的多峰奖励结构。
- 应用:不确定性感知拒答与 lower-confidence-bound 聚合显示分布信息可直接改进奖励模型决策;RLHF 实验中用 DRM 作训练奖励带来策略性能提升。
所属事件:清华团队推出扩散奖励模型,重构人类偏好建模(2 条相关)→
「研究」频道最新
- 论文 LLM-42 登 SOSP 2026:验证式投机让 LLM 推理确定性几乎零开销 — tianyin_xu · 2026-09-30
- 前沿模型能力全是锯齿:平均分第一也不代表能随便换用 — vsikka · 2026-09-30
- 开源库引入可复现随机种子优化器与 recursive 初始化新方法 — leland_mcinnes · 2026-09-30
- Anthropic 红队:GLM-5.3 已能完成二进制利用全控制流劫持 — Simon Willison · 2026-09-30
- 研究者直言部分 AA benchmark 有误导性,已失去信心 — tianyin_xu · 2026-09-30
- 阿德莱德大学提出 DCSD:解耦信用方向与幅度,11 项基准领先 GRPO — AdelaideUniversity · 2026-09-30