LightOn发布开源多语言检索模型mDenseOn与mLateOn
LightOn 团队发布了 307M 参数的完全开源多语言检索模型 mDenseOn 与 mLateOn,主打多语言、长上下文及代码检索。此次开源不仅包含模型权重,还彻底开放了 28 亿对预训练数据、1630 万条微调样本以及完整的训练代码。模型在 BEIR、MLDR 等基准上达到了同级别 SOTA,旨在消除闭源数据带来的复现鸿沟。
已确认
- 要点 模型参数量为 307M,支持 9 种自然语言及代码检索。
- 要点 开源资产包括模型权重、28 亿对预训练数据、1630 万条微调样本以及完整的训练代码。
- 要点 在 BEIR、MLDR、MIRACL 及 MTEB Code 四大基准上达到同级别 SOTA。
- 要点 研究者从 34 个公共来源中清洗重构了 6.65 亿对英文对比预训练数据,并将其翻译为 8 种语言,构建了包含 28 亿对数据的预训练集。
- 要点 尽管没有针对代码的专门预训练,但通过在自建 LateOn-Code 数据上微调,模型展现出了优异的代码检索能力。
为什么重要
- 要点 此次发布提供了目前最大的开源多语言检索训练集之一。@reachsumit 认为该方案旨在消除当前 SOTA 模型因依赖闭源数据而造成的复现鸿沟,@tomaarsen 也强调了其训练数据规模的稀缺性。
2026-07-30 ~ 2026-07-30 · 11 条相关
一手来源
- LightOn 团队发布开源多语言检索模型 mDenseOn 与 mLateOn — antoine_chaffin ·
- LightOn发布多语言检索模型mDenseOn与mLateOn,完全开源28亿训练对 — antoine_chaffin ·
- 149M参数刷新BEIR纪录,LightOn开源多语言检索模型 — _reachsumit ·
- 【源头】149M参数刷新BEIR纪录,LightOn开源多语言检索模型 — _reachsumit · 2026-07-30
- 【源头】LightOn 团队发布开源多语言检索模型 mDenseOn 与 mLateOn — antoine_chaffin · 2026-07-30
- 仅 3 亿参数实现多语言长文档检索,新模型 mLateOn 发布 — antoine_chaffin · 2026-07-30
另有 8 条近重复转述:antoine_chaffin · antoine_chaffin · tomaarsen · antoine_chaffin · IgorCarron · antoine_chaffin · antoine_chaffin · antoine_chaffin