DARLING:在线 RL 中同时优化回复质量与多样性
DanielKhashabi · x · 2026-09-25
- Jason Weston 团队发布 DARLING(Diversity Aware RL),针对后训练导致语言模型回复日趋重复的问题,在在线强化学习中同时优化回复的多样性与质量。
- 方法使用一个学习到的 partition function 来联合建模质量与多样性。
- 实验显示 DARLING 在质量和多样性指标上都超过标准 RL,例如更高的 pass@1 与 pass@k。
- 同时适用于可验证任务与不可验证任务,论文链接已公开。
「模型」频道最新
- 网友前瞻 OpenAI DevDay:难有更强模型,看点或在新工具与硬件 — haider1 · 2026-09-25
- Irregular 承认 AI 评测事故源于评测环境缺陷,而非模型失控 — robleclerc · 2026-09-25
- Cerebras 订阅计划实价 500 美元,页面显示 600 系含 VAT — testingcatalog · 2026-09-25
- 曝 GPT-6 Sol 机器人任务成绩达 GPT-5.6 的 1.6 倍且便宜 47% — ycombinator · 2026-09-25
- OpenRouter 榜单:前十仅 Luna 一个闭源模型,开源全面爆发 — bindureddy · 2026-09-25
- Every 用日常工作自建基准实测 GPT-6 Sol 对阵 Opus 5.5 — every · 2026-09-25