苹果大规模研究:母语做 GRPO 推理训练,效果接近英语

Apple ML Research · rss · 2026-08-18

Apple ML Research 发表论文《GRPO Beyond English》,针对当前 RLVR/GRPO 研究高度以英语为中心的问题,开展了跨基础模型、训练语言和推理语言奖励的大规模多语言实证研究。

核心发现:用模型母语进行推理训练,与直接训练英语推理相比通常只存在很小差距,说明非英语社区也能以本地语言有效开展推理强化学习训练。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →