RLVR 训练存在首因偏差,研究入选 NeurIPS 2026
Parshin Shojaee 等人的论文《On the Primacy Bias in RLVR Training》被 NeurIPS 2026 接收。研究发现大语言模型在强化学习与可验证奖励(RLVR)训练中存在「首因偏差」:模型对早期训练样本「先入为主」、难以遗忘,类似人类的记忆固化现象,这可能影响训练后期样本的学习效果,为 RLVR 训练策略提供了新视角。
2026-09-25 ~ 2026-09-25 · 2 条相关
- RLVR 训练存在「首因偏差」:LLM 难忘早期样本,论文入选 NeurIPS 2026 — ParshinShojaee · 2026-09-25
- RLVR 训练也有「先入为主」:首因偏差研究入选 NeurIPS 2026 — ParshinShojaee · 2026-09-25