GRPO 走出英语:母语推理差距小但平均分掩盖回退,训斯瓦希里语让 Qwen3-4B 英语任务掉 19 分

GRPO Beyond English: A Large-Scale Study of GRPO in Non-English and Multilingual Settings

Konstantin Dobler, Federico Scozzafava, Jonathan Janke, Mohamed Ali, Simon Lehnerer

cs.CL, cs.LG

2026-08-14

九模型十一语言的受控 GRPO 研究:母语推理平均只差 1.3-4.1pp,跨语言迁移强,但特定模型加语言组合会把其他语言的特定能力练崩,训完必须铺宽评测面板。

这篇在解决什么

RLVR 加 GRPO 是当前提升推理能力的主流配方,但研究几乎全在英语上做。非英语和跨语言训练时,该用英语推理还是母语推理、单语训练还是多语训练、会不会把别的语言练崩,这些问题没有系统答案。此前零散结论互相矛盾:有工作说强制母语推理掉分严重,有工作说母语推理对低资源语言反而更好。这篇用一套统一设置把整个矩阵跑了一遍。

方法

九个基座模型:Qwen3-Base(1.7B/4B/8B)、Qwen3(1.7B/4B/8B)、gemma-3(1b-it/4b-it)、SmolLM3-3B。十一个训练语言(英中德法西俄日泰斯瓦希里泰卢固孟加拉)+ 多语混合 + 三个留出语言(意韩葡)。每个基座最多 23 个训练变体。

训练用 DAPO 式 GRPO,无 KL 惩罚,500 步,每步 64 提示 × 8 rollout,学习率 1e-6。奖励是二值正确性,加两项各 0.5 权重的附加奖励:格式奖励、推理语言奖励。推理语言奖励分两档:要求用英语推理,或用提示语言(母语)推理。数据源是 Multilingual Reasoning Gym,程序化生成的数学逻辑谜题,62 个训练任务 30 个留出任务。评测用 avg@8,跨 MGSM、PolyMath(按难度分 Easy Math 和 Hard Math)。

结果

先说母语 vs 英语推理。英语推理奖励平均更好,九个模型上优势 1.3 到 4.1 个百分点。但差距极不均匀:孟加拉、泰卢固、斯瓦希里这些低资源语言英语奖励优势大,法中日德这些高资源语言几乎打平。此前文献里两位数的母语推理掉分,这里没看到。

跨语言迁移是第二块。单语训练的收益大部分迁移到其他语言。法语任务上,只训西班牙语能拿到目标语言训练 25.6pp 增益的 25.6-1.0pp,几乎追平。低资源语言情况不同:斯瓦希里语训练让斯瓦希里评测平均涨 32.2pp,次优迁移语言泰卢固只能给 20.5pp,目标语言数据在低资源场景不可替代。英语经常不是最佳迁移源,Qwen3-4B-Base 和 Qwen3-8B 上,孟加拉语训练对中文的迁移最好。

第三块是回退,这是全文最有价值的发现。Table 2 显示 Qwen3 指令版家族 Hard Math 大面积退步:1.7B 训练语言上 -12.0pp、跨语言 -14.3pp;4B -15.7/-20.7;8B -14.1/-18.1。Qwen3-Base 家族同样训练 Easy Math 涨 50-61pp、Hard Math 也涨,说明这个回退是指令模型的病。更极端的组合退化:Qwen3-1.7B 用泰卢固语训练,英语内容任务(训练没见过)掉 8.1pp;Qwen3-4B 用斯瓦希里语训练,英语内容任务掉 19.2pp、德语 14.8、日语 14.0。训练语言本身的成绩保持不变,多语训练和其他单语训练都不触发这个效应。

推理语言奖励也能触发回退。gemma-3-1b-it 用斯瓦希里语加母语推理奖励,Easy Math 大跌,同配置英语推理奖励反而大涨;gemma-3-4b-it 在孟加拉语上同样;SmolLM3-3B 在中文母语奖励下 Hard Math 退化,英语奖励只是缓解。这些效应是模型加语言的特定组合,gemma-3-1b-it 在孟加拉语上没这事,gemma-3-4b-it 在斯瓦希里语上也没。

为什么重要

给非英语 RLVR 训练的三条实操结论。一,母语推理在多数语言上代价小,低资源语言用英语推理更稳。二,平均分会掩盖回退,训完必须铺一个宽的语言加任务面板检查,尤其英语内容任务和难题这两类易掉项。三,单语训练选语言要小心,某些组合会把其他语言的特定能力练崩,多语混训(含英语提示)能显著缓解 Hard Math 的回退。

局限与存疑

作者自列:训练数据是程序化生成的模板任务,没有真实用户查询的多样性;全部配置共用一套训练配方,没有逐个调参,部分负结果可能调参会缓解;单种子;只覆盖自动可验证的数学逻辑任务,奖励模型、工具使用、开放式任务没碰。另有一条:回退的机制没有解释,为什么 Qwen3 指令版训斯瓦希里会精准打掉英语内容任务而 Base 版不会,论文只描述了现象。9 个模型里 8 个在 8B 以下,结论对大模型的适用性没验证。

术语

---

原文与代码

社区讨论

相关论文

全部论文解读