DARLING 论文入选 NeurIPS:让后训练模型摆脱重复输出
DanielKhashabi · x · 2026-09-25
Daniel Khashabi 实验室的 DARLING 论文被 NeurIPS 接收,研究成员 N8Programs 盛赞这是自己最喜欢的论文之一,也是当初加入 JHU CLSP 实验室的兴奋来源。
论文针对的痛点是:后训练(如 RLHF 类方法)常让语言模型输出趋于重复。DARLING 的思路是在训练奖励中同时鼓励「高质量」与「彼此有实质差异」的回答,以多样性约束缓解模式坍缩。对关注后训练多样性的研究者是一篇值得回看的工作。
所属事件:DARLING 入选 NeurIPS:在线 RL 同时优化回复质量与多样性(2 条相关)→
「研究」频道最新
- Grady Booch 反驳"LLM 收敛出类脑结构":差距仍如鸿沟 — Grady_Booch · 2026-09-25
- ICLR 2027 再爆投稿去匿名化,OpenReview 发布声明 — Striking-Warning9533 · 2026-09-25
- FineVision 开源 VLM 数据集被 NeurIPS 接收:2430 万样本 95 亿 token — andimarafioti · 2026-09-25
- LLM 语言化置信度新论文入选 EMNLP UncertaiNLP 工作坊 — yeewhye · 2026-09-25
- 学者 Valerio Capraro 加入 JBEE 编委会,主管 AI 与行为经济学论文 — ValerioCapraro · 2026-09-25
- ETH Zurich 与 Anthropic 论文:AI 花 2 美元即可人肉匿名账号 — skdh · 2026-09-25