NeurIPS 2026 论文解释 Pass@k 优化为何损害 Pass@1:提示词干扰致梯度冲突
lateinteraction · x · 2026-09-25
一篇被 NeurIPS 2026 接收的论文(arXiv:2602.21189,作者 Anas Barakat、Souradip Chakraborty 等)研究了推理感知微调中反复出现的现象:直接优化 Pass@k 时,Pass@k 提升而 Pass@1 反而下降。
核心结论:
- 原因是「提示词干扰」(Prompt Interference):Pass@k 优化隐式地将提示词向低成功率(更难)的提示重新加权。
- 当这些被上权的提示词产生「负干扰」时,Pass@k 策略梯度会与 Pass@1 梯度发生冲突,把更新方向从 Pass@1 拉走。
- 论文给出了这一权衡何时出现的理论刻画,并在可验证数学推理任务上用 LLM 实验验证。
实践意义:Pass@1 常因延迟/成本预算、验证器覆盖不全和需要可靠的单次回退而成为硬约束,理解该权衡对后训练方法设计很重要。
「模型」频道最新
- GLM 5.3 Flash 九折优惠仅剩一周,批量任务成本低至0.9美分 — shensi · 2026-09-25
- System 1 模型 Jev 正在改变记忆与上下文工程的做法 — julianweisser · 2026-09-25
- 用户质疑两次后 ChatGPT 仍自信报错价,直到被告知答案才去核实 — InternationalFigure2 · 2026-09-25
- 博主实测 Opus 5.5 对比 Astra、Sol、Luna 模型表现 — Rasmic · 2026-09-25
- M5 Ultra 80 核跑 GLM-5.3-Flash:大内存爽,GPU 成瓶颈 — dreamingwell · 2026-09-25
- 开发者实测:Opus 5.5 把 AI 剪辑能力拉高一代 — yihui_indie · 2026-09-25