CRPO用英文偏好当锚做四候选排序,低资源语言指令跟随更稳

Language Chain in Alignment: Cross-lingual Ranking Preference Optimization

Seungyoon Lee, Minhyuk Kim, Jungseob Lee, Heuiseok Lim

EMNLP 2026 Main

cs.CL, cs.AI

2026-08-24

CRPO把目标语与英语的chosen/rejected做成四候选层级,用LambdaLoss做列表排序对齐。Llama-3斯瓦希里语AlpacaEval胜率62.17,低资源上比成对DPO稳得多。

这篇在解决什么

大模型对齐几乎全靠英文偏好数据。DPO把chosen和rejected拉开间隔,在英文上好用,换到中文、韩语、斯瓦希里语就容易两件事一起坏:输出语言跟输入对不上,回答质量也掉。现有多语对齐多半是把英文数据翻译进去,或者在同一batch里做二元跨语比较。模型内部已经有一套相对稳的英文偏好,这些做法没有把它当成锚来用。

二元比较还有一个结构缺陷:一次只看一对,装不下「语言对不对」和「内容好不好」两套顺序。

方法

CRPO把一次训练样本做成四条平行回答:目标语chosen、目标语rejected、英文chosen、英文rejected。相关性标签排成一条链:目标语好回答 > 英文好回答 > 目标语差回答 > 英文差回答。目标语prompt下,模型要同时优化语内偏好和跨语偏好。把目标语chosen放在最上面,等于同时压语言一致性和质量。

优化器从信息检索的LambdaLoss来,不是DPO那种二元logistic。对四条回答的每对,用隐式奖励差乘一个Lambda权重。权重看这条对调换会让nDCG掉多少,排在上面的错位罚得更重。主实验用nDCG2,按两条的名次距离加权;LambdaRank和nDCG2++也试过,三种都强过均匀权重。均匀权重会把层级抹平,英文偏差回来,语言一致性先垮。

增益没有用标准指数折扣(7,3,1,0),手动设成(9,7,5,4),让语内质量间隔大于跨语言间隔,避免模型只会「用对语言」却不管内容。损失是(1-α)的目标语chosen负对数似然加α的LambdaLoss,α=0.2。数据是UltraFeedback抽3000条,用gpt-5-chat译成中、印尼、韩、斯瓦希里、孟加拉五语,与英文严格平行。基座Llama-2-7B、Llama-3-8B、Mistral-7B-v0.1。对照是同数据同超参的SFT+DPO,以及CLO,目标语当chosen、英文当rejected的二元跨语DPO变体。学习率8e-6,两轮,四张A100。

结果

AlpacaEval用gpt-5-chat当裁判,相对SFT报长度控制胜率(LC)和原始胜率(WR),答错语言会扣分。

模型语言CRPO WRSFT+DPO WRCLO WR
Llama-3-8B韩语68.8165.9653.41
Llama-3-8B印尼语68.4060.3752.96
Llama-3-8B斯瓦希里语62.1746.9544.93
Llama-3-8B孟加拉语55.6536.8933.29
Mistral-7B孟加拉语48.5724.5918.01

低资源上对照会塌。Llama-3的SFT+DPO在孟加拉语WR只有36.89,CRPO还能到55.65。斯瓦希里语CRPO的62.17是全文反复点的数字:英文平行对把目标语偏好按住了。AlpacaEval主表多数格子CRPO最高,例外是Llama-2斯瓦希里语,CLO的WR 43.97略高于CRPO的43.72。

知识侧不是横扫。Llama-3印尼语MMMLU:CRPO 45.94,SFT+DPO 41.69,CLO 36.41,比最强对照高4分以上。韩语Belebele 68.66,对照最高59.44。部分格子对照持平或略高,比如Llama-3韩语MMMLU上CLO 40.19、CRPO 39.84。外部奖励模型Skywork-Reward-V2-Qwen3-8B打生成质量:Mistral印尼语SFT+DPO −0.037,CRPO到0.805。Llama-3上CRPO四语奖励全为正,中文1.738、印尼1.883、韩语0.911、斯瓦希里1.122。

机制上,别的方法拉开reward margin,主要靠压低rejected的概率,chosen的对数似然几乎还停在SFT。CRPO两边一起抬:间隔变大,好回答本身也更可能被生成。跟同预算的列表方法PRO比,Llama-3中文WR是62.36对24.97,印尼语68.40对23.11。PRO能把语言说对,质量上不去。

英文AlpacaEval多数配置CRPO也高于对照,对齐税没有被放大。

为什么重要

非英对齐的日常做法是再译一批、再跑一遍DPO。CRPO给出另一条路:把已有英文偏好当成排序里的参照物,一次看四条,语言和质量一起排。训练多算四条候选,比二元DPO贵,但不用外置翻译模型,也不用另训奖励模型。低资源上对照会崩、它不太崩,这是比平均分更有用的信号。权重方案换来换去都赢均匀权重,层级本身比某一种nDCG公式更关键。

局限与存疑

四条候选一步算完,训练算力明显高于二元DPO。评测主表是gpt-4o译过的多语AlpacaEval、人工译的MMMLU和专家审的Belebele,测的是一般能力,测不到文化语境和本地习惯。训练偏好本身也是gpt-5-chat译UltraFeedback,翻译噪声和质量漂移没有单独拆开。五种语言、三个7B/8B基座,更大模型和更多语对没有证据。主实验固定nDCG2,换方案还有空间,但没有按语言动态调增益的办法。

术语

原文与代码

相关论文

全部论文解读