LightOn开源多语言检索模型,登顶BEIR等四大榜单
antoine_chaffin · x · 2026-07-30
LightOn 发布了两款完全开源的 307M 参数多语言检索模型 mDenseOn 和 mLateOn。这两个模型在英文通用检索(BEIR)、长文档检索(MLDR)、多语言检索(MIRACL)以及代码检索(MTEB Code)基准测试中均取得了 SOTA 成绩。
模型基于此前验证的英文数据配方,通过 translate-train 扩展至八种额外语言,构建了包含 28 亿对数据的语料库。最引人注目的是,晚期交互模型(mLateOn)展现出了强大的零样本泛化能力,在完全没见过的语言和脚本(如西里尔字母、中日韩文)上也能保持竞争力,打破了传统翻译-训练管道的局限。模型、数据集和训练代码全部开源。
所属事件:LightOn发布开源多语言检索模型mDenseOn与mLateOn(11 条相关)→
「研究」频道最新
- AI 辅助破解 7 轮 AES 加密,Anthropic 赞助万美元算力 — jedisct1 · 2026-07-30
- AI检测器翻车:LLM生成的随机数被判100%纯AI — nrehiew_ · 2026-07-30
- 重复跑评测并不能提升准确率,研究揭示 LLM 评委的「错误相关性」陷阱 — randal_olson · 2026-07-30
- 研究指 LLM 评测多次投票去噪效果有限,人类标注仍不可替代 — randal_olson · 2026-07-30
- Hugging Face 推出 Agent 协作挑战赛,助力阿尔茨海默症研究 — _lewtun · 2026-07-30
- Papers with Code 新增筛选功能,NVIDIA 顶会论文贡献居前 — NielsRogge · 2026-07-30