LightOn Releases Open-Source 307M Multilingual Retrieval Models

antoine_chaffin · x · 2026-07-30

LightOn has released mDenseOn and mLateOn, two fully open-source 307M-parameter multilingual retrieval models. These models are trained on a massive translate-train corpus of 2.8 billion query-document pairs, supporting 9 natural languages and code retrieval.

Evaluations show that mLateOn achieves the best results on benchmarks like BEIR, target-language MIRACL, and MLDR. Furthermore, mLateOn demonstrates significantly better generalization to languages and scripts unseen during retrieval training compared to mDenseOn (e.g., averaging 67.59 vs 57.42 on MIRACL). The team has open-sourced the models, datasets, and training code.

Related event: LightOn Releases 307M Open-Source Multilingual Retrieval Models with 2.8B Training Pairs(13 posts)→

Original post →

More from Models

Models channel →