不靠平行语料做强化学习,小米开源 12B 多语翻译模型超过 GPT-5

Reference-Free Post-Training of Open Large Language Models for Multilingual Machine Translation

Chris Han, Pengzhi Gao, Pei Fu, Jian Luan

cs.CL, cs.AI

2026-08-11

用两个无参考质量模型做 GRPO 奖励、再和 SFT 检查点插值,开源 12B 模型在 46 语种 WMT24++ 上超过 Google、Gemini 3 Pro、GPT-5。

这篇在解决什么

多语种机器翻译的监督学习卡在平行语料上:高质量的对齐句对稀缺且分布不均,低资源语种和非英语中心方向尤其缺。这篇想用单语数据做后训练,不需要参考译文。

具体是给一个已经做监督微调的多语翻译模型(MiLMMT-46-v0.1,覆盖 46 个语种)做强化学习,奖励信号来自不依赖参考译文的质量评估模型。模型来自小米,代码和权重都开源在 gemmax 仓库。

方法

用 GRPO(Group Relative Policy Optimization)做 RL,这是 LLM 后训练里常用的一种策略梯度算法:每次对同一个输入采一组翻译,用组内的相对优势来更新策略,不需要单独训一个价值模型。

奖励是两个无参考质量模型 XCOMET 和 COMETKiwi 的平均分。这两个都是 QE(质量评估)模型,直接对译文打分,不需要参考答案,XCOMET 偏向语义层面的匹配,COMETKiwi 专门为无参考场景设计。奖励再用语种识别做门控:如果输出语种跟目标对不上,奖励直接归零,防止模型偷懒输出错语种拿分。

只跑 RL 会让模型在某些指标(如 spBLEU)上退步,因为 RL 优化的是 QE 分数不是字面重叠。所以最后把 SFT 检查点和 RL 检查点做线性插值 θ = α·θSFT + (1-α)·θRL,α 取 0.5,得到 MiLMMT-46-v1.0,既拿到 RL 的语义质量提升,又保住 SFT 的字面稳健性。作者还试了 on-policy 蒸馏,发现它能把这些增益迁到更小模型,但没能超过 RL 加插值的上限。

结果

在 WMT24++ 的 46 语种评测上(XCOMET/COMETKiwi,两个都是质量模型分数,越高越好):

系统XCOMETCOMETKiwi
MiLMMT-46-12B-v1.087.8884.06
Gemini 3 Pro85.0381.70
GPT-584.8682.10
Google Translate83.2980.46

12B 的开源模型在这两个指标上超过了 Google、Gemini 3 Pro、GPT-5。相比 v0.1(纯 SFT),平均涨 2.75(XCOMET)和 2.44(COMETKiwi),而且 1B、4B、12B 三个规模上都成立,说明这套方法不挑模型大小。在 FLORES+ 上也胜过 Seed-X(95.95 vs 97.58)、HY-MT2(93.87 vs 95.73)、TranslateGemma(95.14 vs 96.09)等开源基线。参考型指标 spBLEU 上跟 GPT-5 基本打平(35.14 对 34.94)。

为什么重要

无参考的 RL 后训练让模型自己当「裁判」迭代翻译质量,绕开了平行语料的瓶颈,对低资源语种尤其值钱。小米把 1B、4B、12B 三档模型和代码都开源了,等于给社区一套可复现的多语翻译基线。RL 加检查点插值这个组合简单有效,能迁到其它需要平衡两个检查点的任务。

局限与存疑

虽然质量模型分数大涨,参考型 spBLEU 反而降了约 1.2 分(作者辩称 spBLEU 不太可靠)。奖励模型本身是不完美的估计器,可能鼓励 reward hacking,模型学的是怎么拿高分未必真翻得好。on-policy 蒸馏没能突破 RL 的上限。作者承认需要更鲁棒、更贴近人类判断的奖励模型。

术语

原文与代码

相关论文

全部论文解读