苹果大规模研究:母语做 GRPO 推理训练,效果接近英语
Apple ML Research · rss · 2026-08-18
Apple ML Research 发表论文《GRPO Beyond English》,针对当前 RLVR/GRPO 研究高度以英语为中心的问题,开展了跨基础模型、训练语言和推理语言奖励的大规模多语言实证研究。
核心发现:用模型母语进行推理训练,与直接训练英语推理相比通常只存在很小差距,说明非英语社区也能以本地语言有效开展推理强化学习训练。
「研究」频道最新
- 高斯混合模型与指数族密度逼近转换 — FrnkNlsn · 2026-08-24
- Netflix 揭秘 LLM Judge 生产实践:每周评估数十万条推荐解释 — omarsar0 · 2026-08-24
- Nature 评论:数据溯源是自主科学的信任基石 — gabepgomes · 2026-08-24
- 新架构 RHEA:8GB 显存即可训练 10 亿参数模型 — zemondza · 2026-08-24
- 跳过 LLM 写代码老套路:自训 16M 参数模型做生成式 CAD — debreuil · 2026-08-24
- Claude 助手发现 6 维球复结构,解 60 年数学难题 — Singularitarian · 2026-08-24