DARLING 入选 NeurIPS:在线 RL 同时优化回复质量与多样性

Jason Weston 团队与约翰霍普金斯大学合作发布 DARLING(Diversity Aware RL),针对后训练强化学习导致语言模型回复日趋重复的问题,在在线强化学习中同时优化回复质量与多样性。该论文已被 NeurIPS 接收,研究成员 N8Programs 表示这是自己最喜欢的论文之一,也是当初加入 JHU CLSP 的原因。

2026-09-25 ~ 2026-09-25 · 2 条相关