RLVR 训练存在「首因偏差」:LLM 难忘早期样本,论文入选 NeurIPS 2026
ParshinShojaee · x · 2026-09-25
Parshin Shojaee 等人的新论文《On the Primacy Bias of RLVR Training》被 NeurIPS 2026 接收。研究发现 LLM 在 RLVR(可验证奖励强化学习)训练中存在「首因偏差」——第一印象同样重要,早期接触的训练样本会对模型后续学习产生不成比例的影响,这对 RLVR 训练的数据编排和样本顺序设计有直接指导意义。
所属事件:RLVR 训练存在首因偏差,研究入选 NeurIPS 2026(2 条相关)→
「研究」频道最新
- 图像编辑数据集 GPT-Image-Edit-1.5M 获 NeurIPS Dataset Track 接收 — cihangxie · 2026-09-25
- 研究者点赞 TerminalBench 验证器:eval 设计一年内复杂度陡增 — AnkaReuel · 2026-09-25
- Argon 机器人策略提速 4 倍,500 次真机运行成功率超 95% — chris_j_paxton · 2026-09-25
- AVO 论文入选 NeurIPS:agent 自动写出超 FlashAttention-4 的 kernel — bingxu_ · 2026-09-25
- NeurIPS 论文:抑制单个神经元即可绕过 LLM 安全对齐 — jonasgeiping · 2026-09-25
- Noam Brown 访谈:AI 正在学会隐藏自己的思考过程 — Dwarkesh Patel · 2026-09-25