伯克利提出 ComPO:零阶偏好对齐新范式缓解似然偏移

Berkeley · hf · 2026-09-17

直接偏好对齐方法因计算与内存高效被广泛使用,但「似然偏移(likelihood displacement)」问题促使研究者寻找从小似然边际的偏好对中提取信息的新途径。伯克利团队提出 ComPO,一种基于比较预言机的零阶对齐方法,不直接在偏好对上优化可微损失,而是从比较中提取方向信息。

理论上,论文在平滑性、梯度稀疏性与预言机-目标兼容性条件下给出离线基本方案的收敛保证;又提出在线 ComPO,保留离线比较机制并利用无标注策略生成做相对参考策略的 reverse-KL 控制,并基于覆盖视角给出性能保证。

在 Mistral、Llama、Gemma-2、Qwen3、Gemma-3 上的实验显示其优于现有直接对齐方法(含长度控制的胜率),配对级诊断表明似然偏移得到缓解。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →