DARLING 论文入选 NeurIPS:让后训练模型摆脱重复输出

DanielKhashabi · x · 2026-09-25

Daniel Khashabi 实验室的 DARLING 论文被 NeurIPS 接收,研究成员 N8Programs 盛赞这是自己最喜欢的论文之一,也是当初加入 JHU CLSP 实验室的兴奋来源。

论文针对的痛点是:后训练(如 RLHF 类方法)常让语言模型输出趋于重复。DARLING 的思路是在训练奖励中同时鼓励「高质量」与「彼此有实质差异」的回答,以多样性约束缓解模式坍缩。对关注后训练多样性的研究者是一篇值得回看的工作。

所属事件:DARLING 入选 NeurIPS:在线 RL 同时优化回复质量与多样性(2 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →