NeurIPS 2026 论文解释 Pass@k 优化为何损害 Pass@1:提示词干扰致梯度冲突

lateinteraction · x · 2026-09-25

一篇被 NeurIPS 2026 接收的论文(arXiv:2602.21189,作者 Anas Barakat、Souradip Chakraborty 等)研究了推理感知微调中反复出现的现象:直接优化 Pass@k 时,Pass@k 提升而 Pass@1 反而下降。

核心结论:

实践意义:Pass@1 常因延迟/成本预算、验证器覆盖不全和需要可靠的单次回退而成为硬约束,理解该权衡对后训练方法设计很重要。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →