反对称偏好嵌入打满分循环关系,Gemma-2B 上比 BT 奖励模型高 7.4 分

Beyond Bradley-Terry Models: A General Preference Model for Language Model Alignment

Yifan Zhang, Ge Zhang, Yue Wu, Kangping Xu, Quanquan Gu

ICML 2025)

cs.AI, cs.CL, cs.LG

2024-10-03

清华与 UCLA 提出 GPM:把每条回复嵌成反对称向量,K 条候选只需线性次前向。循环偏好上打满分,Gemma-2B 的 RewardBench 均分从 BT 的 74.85 提到 82.29。

这篇在解决什么

现有偏好建模卡在两个极端。Bradley-Terry(BT)奖励模型给每条回复打一个标量分,K 条候选只需 O(K) 次前向,便宜,但隐含「偏好可传递」:A 赢 B、B 赢 C,A 就一定赢 C。人的判断经常不这样。石头剪刀布是教科书例子;同一道题上「更诚实」和「更有帮助」互相打架,也会走出环。

另一头是 PairRM / PairPM:把两条回复拼进同一个 prompt 做二分类,理论上能表达任意成对关系,包括循环。代价是排满 K 条要 O(K²) 次前向,位置编码和因果注意力还会让左右顺序影响分数。test-time scaling 要给几十条推理轨迹打分时,这个二次项会先爆。

ICML 2025 这篇(清华 IIIS、上海期智、UCLA,通讯作者 Quanquan Gu)问的是:有没有一种既保线性查询、又能表达非传递偏好的写法。

方法

核心叫 preference embedding。给定 prompt x,每条回复 y 被映成一个 2k 维向量 v。偏好分数把其中一个向量乘上固定的反对称算子 R≻,再跟另一个做内积:

s(yi ≻ yj | x) = ⟨R≻ vi, vj⟩

R≻ 是块对角矩阵,每块都是二维旋转 [[0, -1], [1, 0]],相当于把向量在平面上转 90 度。两个向量的内积于是编码「谁顺时针压过谁」:石头剪刀布那种环,在二维里就是三个差开角度的方向。这个设计带出两条硬性质。s(i≻j) = −s(j≻i),自己跟自己比一定是 0;R≻ 不改变向量长度,训练时数值更稳。k=1 且 v = [r, c] 时,公式退回 BT。定理 4.4 证明,任意实反对称偏好矩阵都能被这套嵌入表示,循环关系在表达力上被覆盖了。

落地时在语言模型最后一层隐状态上加两个头:

训练损失跟 BT 一样是成对交叉熵,数据用去污染后的 Skywork Reward Data Collection,大约 8 万对,训两轮。对齐阶段把这个分数接到 General Preference Optimization(GPO):目标最大化 log-odds 分数 s,s 可以取任意实数;胜率 P 只在 (0,1) 里走。迭代形式上接近 SPPO 的 multiplicative weights 更新,把每条回复对当前策略的平均分当成广义奖励。GPM 的分数也能塞进 DPO、IPO、PPO、NLHF 这类现成算法。

结果

最硬的对照是他们自造的 CyclicPreference。从 Ultrafeedback 里筛出至少三条回复、且在 instruction following / honesty / truthfulness / helpfulness 上能拼出环的样本,四个子集各 216 到 363 条。Gemma-2B-it 做底座:

BT 准确率GPM 准确率
Honesty ≻ Truthful ≻ Helpful ≻ Honesty62.4%100%
IF ≻ Truthful ≻ Helpful ≻ IF61.6%100%
IF ≻ Honesty ≻ Helpful ≻ IF50.0%100%
IF ≻ Honesty ≻ Truthful ≻ IF62.9%100%

BT 在第三条环上等于随机猜。GPM 四条都满分。

RewardBench 上两边都用同一份 Skywork 数据。Gemma-2B-it 上,嵌入维 6 的 GPM 均分 82.29,BT 是 74.85,差 7.44 分;Chat 从 67.32 到 79.61,Chat-Hard 从 63.37 到 75.66。Llama-3.1-8B-Instruct 上差距收窄:GPM 维 8 均分 91.90,BT 90.56,只多 1.34 分。Safety 和 Reasoning 两栏 GPM 并不稳赢,8B 上甚至略低于 BT(Safety 91.08 vs 91.49,Reasoning 95.44 vs 96.47)。

下游用 Llama-3-8B-Instruct 做策略,GPM / BT 分别当裁判,跑 SPPO 和 GPO 各三轮,AlpacaEval 2.0 用 GPT-4-turbo 打分。2B GPM + GPO 第三轮原始胜率 48.25,BT + GPO 是 44.20;长度控制胜率(LC.WR)反过来,GPM 37.74、BT 42.21,平均长度 2582 vs 2151 token。8B 更夸张:GPM + GPO 第三轮平均长度飙到 3249,BT 只有 1969。MT-Bench 上并不一边倒,8B GPM + GPO 第三轮均分掉到 7.54,同设置 BT 是 8.26。

他们试过按回复长度归一化的 LN-GPO,2B 上 LC.WR 几乎打平(45.55 vs 45.51),GPM 仍然更长。

为什么重要

给奖励模型换头几乎零成本:多一个低维线性层,查询次数仍是 O(K),Best-of-N 和 test-time ranking 不用改采样流程。2B 这种小裁判上收益最大,Chat / Chat-Hard 这种「哪条更像人」的题型差得最开。循环偏好的满分说明一件结构性的事:只要真实数据里存在跨维度的环,标量奖励在形式上就写不出来,调参补不上那一维。

8B 上 RewardBench 只多 1.3 分,AlpacaEval 的 LC.WR 还经常输给 BT。这更接近一次表达力补丁,不是全面换代。想上线的话,先看自己的偏好数据有没有环、裁判是不是小模型。有环、模型小,GPM 值得换;数据近似全序、已经在用大 RM,收益可能薄。

局限与存疑

循环实验的测试准确率是在训练集上换了一组比较对,不是独立测试集,而且 50 个 epoch、batch size 1,216–363 条样本很容易背下来。环本身是把不同评分轴拼出来的,不是同一条准则下的自然循环。附录给了几条 Ultrafeedback 原数据里的环,但主表数字来自构造集。

没有和 PairRM 做同算力对照,只打了 BT。Safety 不涨、长度明显膨胀、MT-Bench 在 8B 第三轮还退步,多维嵌入可能在学「写长、写全」,不一定在学更准的偏好。GPO 把归一化项 log Z 直接换成 0,后期策略接近均衡时说得通,早期偏差多大,论文没量化。正文点名评了 GSM8K、MMLU,附录里没有数字。

术语

原文与代码

社区讨论

相关论文

全部论文解读