RLVR 训练存在「首因偏差」:LLM 难忘早期样本,论文入选 NeurIPS 2026

ParshinShojaee · x · 2026-09-25

Parshin Shojaee 等人的新论文《On the Primacy Bias of RLVR Training》被 NeurIPS 2026 接收。研究发现 LLM 在 RLVR(可验证奖励强化学习)训练中存在「首因偏差」——第一印象同样重要,早期接触的训练样本会对模型后续学习产生不成比例的影响,这对 RLVR 训练的数据编排和样本顺序设计有直接指导意义。

所属事件:RLVR 训练存在首因偏差,研究入选 NeurIPS 2026(2 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →