RLVR 训练也有「先入为主」:首因偏差研究入选 NeurIPS 2026

ParshinShojaee · x · 2026-09-25

Parshin Shojaee 等人的新论文《On the Primacy Bias in RLVR Training》被 NeurIPS 2026 接收。研究指出 LLM 在 RLVR(可验证奖励强化学习)训练中存在「首因偏差」——模型对早期接触的训练内容有持久的偏好,第一印象影响后续学习效果。论文细节可见其项目页面。

所属事件:RLVR 训练存在首因偏差,研究入选 NeurIPS 2026(2 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →