4000 条示范就够:PARED 反推的对齐奖励无需任何偏好标注

Inverse RL Helps Align AI by Imitating Humans

Michał Wiliński, Liu Leqi, Chirag Nagpal

cs.LG

2026-07-28

PARED 用轻量判别器把示范与策略样本在低维特征空间分开,反推出可审计的奖励,全程无需偏好标注;best-of-N 取胜 63.4%,SFT 之上再做策略优化达 88.4%。

这篇在解决什么

对齐语言模型,主流只有两条路:拿示范做监督微调(SFT),或拿偏好比较训奖励模型再做 RLHF、DPO。两条路都把专家示范用窄了。SFT 只让模型照抄示范的字符串,并不还原出一个能被检查、能被复用、能用策略梯度去优化的显式目标;示范里那些没被逐字模仿的东西,比如该更简洁、该更安全,就提炼不出来。

作者问的是一个被搁置的问题:光靠示范,能不能反推出一个奖励,既看得见、又能拿去优化?

方法

PARED(Projected Alignment Reward Estimated from Demonstrations)借鉴逆强化学习。它的判别不在原文本上进行:先把每条回复映射到一组人工选定的低维特征上,再训一个轻量判别器把「专家示范」和「策略自己生成的样本」在这组特征里分开。判别器给出的「像专家」分数,就是对数奖励 r = log D。

具体到这篇的实现,特征只有七维:两个用 gemma-3-27b-it 打的有用性、无害性分数(各除以 10),加上五个 LDA 主题分布坐标。回复长度被刻意排除,因为它在策略优化下会变成可钻的空子。判别器是这七维的二阶展开(原坐标、平方、两两乘积)上的逻辑回归,本身极轻。

和标准奖励模型的关键差别在监督来源:奖励模型要专门采偏好标注,PARED 只要示范;示范提供任务相关的监督,需要的话还能把 AI 反馈作为额外维度并进来。因为奖励是定义在具名特征上的,它天然可审计,你能看到是哪个特征、哪种交互在驱动打分。

拿到的奖励有两种用法:推理期 best-of-N 重排,从一批候选里挑分最高的,不动模型权重;或作为 KL 正则的 on-policy 强化学习奖励,用 GRPO 优化。

结果

数据集基于 Anthropic/hh-rlhf,专家示范由带受众前缀的 GPT-5.1 生成,分成人、儿童两种受众;4000 条训练,1998 条测试。基座是 Qwen2.5-3B-Instruct 加 LoRA。

判别器在留出集上把 GPT-5.1 示范与 GPT-OSS-20B 策略样本分开的 AUC 是 0.849;同模型对照(两边都用 GPT-5.1、只差示范提示)也有 0.616,说明分数追的是示范行为本身,不是生成者身份。

设置对基座的胜率
SFT(4000 条)81.1%
best-of-N 重排(16 选 1)取胜 63.4%
PARED 从 Instruct 出发(在线判别器)84.6%
PARED 叠在 SFT 之上(冻结)对自身 SFT 初值胜 88.4%
PARED(500 条,从 Instruct 出发)70.7%

两个判断要分清:从零开始的 PARED 虽然对基座达到 84.6%、略高于 SFT 的 81.1%,但直接和 SFT 比只赢 31.7%,所以它不替代 SFT。更自然的配方是先 SFT 把示范榨干,再 on-policy 优化这个反推出来的奖励,这正是「叠在 SFT 之上」那组在做的事,对自身 SFT 初值胜 88.4%。受众拆开看,成人和儿童两个条件都在涨,不是靠某一个受众撑出来的。

为什么重要

对做对齐的人,PARED 给了一个介于「照抄示范」和「另起炉灶训奖励模型」之间的选项:只要你有示范,就能反推出一个便宜、可解释、可复用的奖励,省掉采偏好标注的成本。它还能做上下文对齐,同一个策略,靠不同受众各自的奖励,被裁成针对不同人群的行为。最实际的用法不是拿来替代 SFT,而是接在 SFT 后面再压一层,把示范里 SFT 没提炼到的信号榨出来。

局限与存疑

作者自己把它定位成「用到语言模型对齐上的经典对抗模仿学习」,没假装是全新范式。几条硬边界值得记着:示范在这篇里是前沿模型生成的,不是真人数据;判别器信号会随策略逼近示范分布而天然变弱;下游质量靠单个换序 LLM 裁判(gemini-2.5-flash)评,部分增益可能只是裁判偏好的文风或长度,给出的区间只反映有限评测的噪声,不含裁判和训练随机性;而且只在一个基座、一组特征、两个受众上验过,推广性没测。更根本的是,策略优化的仍是学出来的代理奖励,reward over-optimization 的老风险并没有消失。

术语

原文与代码

社区讨论

相关论文

全部论文解读