Llama 2 自当裁判三轮DPO,赢过GPT-4 0613

Self-Rewarding Language Models

Weizhe Yuan, Richard Yuanzhe Pang, Kyunghyun Cho, Xian Li, Sainbayar Sukhbaatar, Jing Xu, Jason Weston

ICML 2024

cs.CL, cs.AI

2024-01-18

Llama 2 70B 自己打分再做三轮 DPO,AlpacaEval 2.0 对 GPT-4 Turbo 胜率从 9.94% 升到 20.44%,超过 GPT-4 0613。

这篇在解决什么

标准 RLHF 先用人偏好训一个奖励模型,再冻住它去训策略。DPO 连奖励模型都不训,直接吃人标的偏好对。两条路都卡在同一处:人能标多少、标多好,训练信号就停在那里。奖励模型一旦冻住,策略再训也不会让打分能力跟着涨。

论文的出发点更硬:要做超人智能体,反馈本身也得超过人。Meta 与 NYU 把策略和裁判塞进同一个 Llama 2 70B。模型既写回答,也用 LLM-as-a-Judge 给自己的候选打分,再用这些自造偏好对做 Iterative DPO。裁判不是外挂,打分能力会随迭代一起动。

方法

起点是 Llama 2 70B 基座。先用 Open Assistant 里 3200 条高质量英文首轮对话做 Instruction Fine-Tuning(IFT),再用 1630 条「如何打分」的 Evaluation Fine-Tuning(EFT)把裁判格式教进去。EFT 的 chain-of-thought 不是人手写的:让 IFT 模型先打分,只有排序与人标一致才收下,并丢掉过多的 4 分样本,避免分数塌成一片 4。

之后每一轮做三件事:

最高分对最低分做成偏好对,同分丢掉。M1 造出 3964 对,DPO 训出 M2;M2 造出 6942 对,训出 M3。DPO 的 β 取 0.1。

裁判 prompt 用加法计分,不用分桶选择题。SFT 基线上,加法式与人偏好的 pairwise accuracy 是 65.1%,Li 等人那种分桶 prompt 只有 26.6%。这个选择决定了后面整条回路能不能转起来。

结果

AlpacaEval 2.0 对 GPT-4 Turbo 的胜率:M1 为 9.94%,M2 为 15.38%,M3 为 20.44%。M3 超过 Claude 2 的 17.19%、Gemini Pro 的 16.85%、GPT-4 0613 的 15.76%,以及 Llama 2 Chat 70B 的 13.87%。对照模型多数吃过百万级专有对齐数据或更强模型蒸馏,这边种子只有 Open Assistant 那几千条。

GPT-4 头对头(256 条):M2 对 M1 是 55.5% 对 11.7%;M3 对 M2 是 47.7% 对 12.5%;M3 对 SFT 基线是 62.5% 对 9.8%。作者三人盲评 50 条,M3 对 SFT 是 66% 对 18%,方向一致。

模型AlpacaEval 2.0 胜率MT-Bench裁判 pairwise acc.
SFT 基线(仅 IFT)未报6.8565.1%
M1(IFT+EFT)9.94%6.7878.7%
M215.38%7.0180.4%
M320.44%7.2581.7%

MT-Bench 写作、角色扮演、抽取、STEM 涨得明显,数学和代码几乎不动。只加 11254 条满分样本做 SFT,头对头是 29% 对 30%,等于没涨。没有 EFT、只靠 IFT 启动的回路,打分会塌成几乎全是 4 分,能收下的偏好对只剩 541 和 429,后面明显掉队。

裁判自己也在变好。中间没有再加人标的打分数据,pairwise accuracy 仍从 M1 的 78.7% 爬到 M3 的 81.7%。论文的解释是:指令跟随变强,作为指令任务的打分也跟着强。

为什么重要

从业者能拿走的是一条可复现的回路:同一套权重既当 policy 又当 judge,Iterative DPO 能让两边一起涨。这和 Constitutional AI、RLAIF 不同。那些工作用另一个 LLM 产反馈,再训一个冻住的奖励模型。这里裁判就是策略自己,下一轮数据质量会跟着裁判变好。

代价也很清楚。种子数据偏闲聊和写作,数学、代码、逻辑几乎吃不到这个回路。想用在硬推理上,得换种子任务,不能指望同一套 Open Assistant prompt 自己长出解题能力。

局限与存疑

作者只跑了三轮、一个 70B 设置,饱和点没测。AlpacaEval 上回答长度从 M1 的 1092 涨到 M2 的 1552、M3 的 2552。长度和「看起来更好」高度相关,胜率里有多少是写长了,论文点了但没拆开。

训练奖励和部分评测都是 LLM:自己当 judge,AlpacaEval 与 MT-Bench 用 GPT-4。人和自动评方向一致,但 50 条作者自评撑不起「没有 reward hacking」这个结论。安全评测完全没做。主实验里新 prompt 仍由冻住的 Llama 2-Chat 生成,不是用户真实分布。

把这篇当成「RLAIF 已经存在之后,把裁判和策略合成同一个会迭代的模型」来读,位置才准确。它没有证明超人反馈已经到手,只证明在这套评测上,自我打分的 DPO 回路至少能转三轮、两边都涨。

术语

原文与代码

社区讨论

相关论文

全部论文解读