Xiaomi's Open Multilingual Translation Model Outperforms Proprietary Baselines

xiaomi-research · hf · 2026-08-12

Xiaomi's research team proposes a reference-free post-training method for open-source LLMs to enhance multilingual machine translation.

The approach utilizes Group Relative Policy Optimization (GRPO) with reference-free quality rewards alongside checkpoint interpolation. Experiments demonstrate that open-source models optimized with this post-training method not only surpass other strong open-source models but also defeat mainstream proprietary baselines.

Original post →

More from Models

Models channel →