Reference-Free Post-Training of Open Large Language Models for Multilingual Machine Translation
Chris Han, Pengzhi Gao, Pei Fu, Jian Luan
cs.CL, cs.AI
2026-08-11
用两个无参考质量模型做 GRPO 奖励、再和 SFT 检查点插值,开源 12B 模型在 46 语种 WMT24++ 上超过 Google、Gemini 3 Pro、GPT-5。
多语种机器翻译的监督学习卡在平行语料上:高质量的对齐句对稀缺且分布不均,低资源语种和非英语中心方向尤其缺。这篇想用单语数据做后训练,不需要参考译文。
具体是给一个已经做监督微调的多语翻译模型(MiLMMT-46-v0.1,覆盖 46 个语种)做强化学习,奖励信号来自不依赖参考译文的质量评估模型。模型来自小米,代码和权重都开源在 gemmax 仓库。
用 GRPO(Group Relative Policy Optimization)做 RL,这是 LLM 后训练里常用的一种策略梯度算法:每次对同一个输入采一组翻译,用组内的相对优势来更新策略,不需要单独训一个价值模型。
奖励是两个无参考质量模型 XCOMET 和 COMETKiwi 的平均分。这两个都是 QE(质量评估)模型,直接对译文打分,不需要参考答案,XCOMET 偏向语义层面的匹配,COMETKiwi 专门为无参考场景设计。奖励再用语种识别做门控:如果输出语种跟目标对不上,奖励直接归零,防止模型偷懒输出错语种拿分。
只跑 RL 会让模型在某些指标(如 spBLEU)上退步,因为 RL 优化的是 QE 分数不是字面重叠。所以最后把 SFT 检查点和 RL 检查点做线性插值 θ = α·θSFT + (1-α)·θRL,α 取 0.5,得到 MiLMMT-46-v1.0,既拿到 RL 的语义质量提升,又保住 SFT 的字面稳健性。作者还试了 on-policy 蒸馏,发现它能把这些增益迁到更小模型,但没能超过 RL 加插值的上限。
在 WMT24++ 的 46 语种评测上(XCOMET/COMETKiwi,两个都是质量模型分数,越高越好):
| 系统 | XCOMET | COMETKiwi |
| MiLMMT-46-12B-v1.0 | 87.88 | 84.06 |
| Gemini 3 Pro | 85.03 | 81.70 |
| GPT-5 | 84.86 | 82.10 |
| Google Translate | 83.29 | 80.46 |
12B 的开源模型在这两个指标上超过了 Google、Gemini 3 Pro、GPT-5。相比 v0.1(纯 SFT),平均涨 2.75(XCOMET)和 2.44(COMETKiwi),而且 1B、4B、12B 三个规模上都成立,说明这套方法不挑模型大小。在 FLORES+ 上也胜过 Seed-X(95.95 vs 97.58)、HY-MT2(93.87 vs 95.73)、TranslateGemma(95.14 vs 96.09)等开源基线。参考型指标 spBLEU 上跟 GPT-5 基本打平(35.14 对 34.94)。
无参考的 RL 后训练让模型自己当「裁判」迭代翻译质量,绕开了平行语料的瓶颈,对低资源语种尤其值钱。小米把 1B、4B、12B 三档模型和代码都开源了,等于给社区一套可复现的多语翻译基线。RL 加检查点插值这个组合简单有效,能迁到其它需要平衡两个检查点的任务。
虽然质量模型分数大涨,参考型 spBLEU 反而降了约 1.2 分(作者辩称 spBLEU 不太可靠)。奖励模型本身是不完美的估计器,可能鼓励 reward hacking,模型学的是怎么拿高分未必真翻得好。on-policy 蒸馏没能突破 RL 的上限。作者承认需要更鲁棒、更贴近人类判断的奖励模型。