GRPO 走出英语世界:大规模实证研究发现跨语言迁移强但存在隐性回退
May_F1_ · x · 2026-08-17
arXiv 新论文《GRPO Beyond English》对 RLVR/GRPO 在非英语与多语言场景下做了大规模实证研究,覆盖多种基座模型、训练语言与推理语言奖励设置。
核心发现:
- 用母语推理训练与英语推理训练的差距通常很小;
- 跨语言迁移显著:用一种语言训练往往能提升多种语言的性能;
- 但具体表现高度依赖模型与语言组合,某些语言训练会在其他语言上引发严重的域外能力回退。
结论:英语之外的 RLVR 能带来广泛跨语言收益,但必须配合足够广泛评测,才能捕捉语言特有的回退问题。
「研究」频道最新
- 微软研究:4B 小模型经 SocialRL 训练,谈判能力反超 GPT-5 系列 — dair_ai · 2026-08-17
- 数学成本骤降,用定理验证替代实验探索 Transformer — DimitrisPapail · 2026-08-17
- AI 结合数据科学:向实时预测洞察演进 — mdancho84 · 2026-08-17
- 递归自我改进难度被低估,AI 难产新创意 — sarahcat21 · 2026-08-17
- Pathway 小模型打破 ARC-AGI 成本效率纪录 — dank_philosopher · 2026-08-17
- Ben Recht 提议「微会议」:取代万人学术大会的知识生产方式 — beenwrekt · 2026-08-17