Diffusion Reward Models:让奖励模型学习人类偏好分布而非单一分数
burny_tech · x · 2026-09-30
团队提出 Diffusion Reward Models(DRM),挑战 LLM 后训练中奖励模型的主流假设:传统 RM 把人类偏好压缩为单一标量分数,但人类反馈往往不是点估计——不同人对同一回答可能有明显分歧甚至冲突。DRM 尝试让奖励模型学习人类偏好的分布而非单点,以保留偏好数据的多样性信号。论文、代码与模型均已开源。
所属事件:清华团队推出扩散奖励模型,重构人类偏好建模(2 条相关)→
「研究」频道最新
- UniMate 开源:一个模型统一驱动多种骨骼的文本生成动画 — grandorganics · 2026-09-30
- kalomaze:直通估计器在二值权重反向传播下其实完全可用 — kalomaze · 2026-09-30
- 新论文提出 RGI:数据流才是塑造 LLM 泛化的关键变量 — zhuoran_yang · 2026-09-30
- GamowLabs 发布 LabBench:AI agent 难以选对下一个关键实验 — danielmckinn0n · 2026-09-30
- Toby Ord:λ 高度依赖任务,AI 研发极限并行化才是关键问题 — tobyordoxford · 2026-09-30
- davidad 上线交互页面,可视化测试贝叶斯认知模型 — davidad · 2026-09-30