GRPO 走出英语世界:大规模实证研究发现跨语言迁移强但存在隐性回退

May_F1_ · x · 2026-08-17

arXiv 新论文《GRPO Beyond English》对 RLVR/GRPO 在非英语与多语言场景下做了大规模实证研究,覆盖多种基座模型、训练语言与推理语言奖励设置。

核心发现:

结论:英语之外的 RLVR 能带来广泛跨语言收益,但必须配合足够广泛评测,才能捕捉语言特有的回退问题。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →