LightOn发布307M参数开源多语言检索模型
antoine_chaffin · x · 2026-07-30
LightOn 团队发布了 mDenseOn 和 mLateOn 两款完全开源的 307M 参数多语言检索模型。这些模型基于包含 28 亿对查询与文档的大规模翻译训练语料库,支持 9 种自然语言及代码检索。
评估结果显示,mLateOn 在 BEIR、目标语言 MIRACL 和 MLDR 等基准上取得了最佳表现。此外,在未见过检索训练的语言和脚本上,mLateOn 展现出了远超 mDenseOn 的泛化能力(例如在 MIRACL 上平均得分 67.59 vs 57.42)。团队已全面开源模型、数据集和训练代码。
所属事件:LightOn 完全开源多语言检索模型及 28 亿对训练数据(11 条相关)→
「模型」频道最新
- CrisperWhisper2.0 上榜 HF:高精度逐字转写与词级时间戳 — nyralabs · 2026-07-31
- 开发者实测:把 Claude Opus 当作不可控的疯狂 Agent 效果更好 — brandon_galang · 2026-07-30
- Kimi K3 架构深度解析:Together AI 联合举办技术对谈 — togethercompute · 2026-07-30
- Gemini ER 2 具身推理评测全面超越 Claude Opus 与 Sol — Zergylord · 2026-07-30
- Gemini 机器人模型实测:精准拆解9分钟挖掘机视频 — DynamicWebPaige · 2026-07-30
- Kimi K3 上下文压缩后状态丢失?开发者深扒 API 载荷 — Few_Sort8392 · 2026-07-30