LightOn 发布多语言检索模型,28亿对数据刷新 SOTA
antoine_chaffin · x · 2026-07-30
LightOn 发布了 307M 参数的多语言检索模型 mDenseOn 和 mLateOn。
- 性能表现:在 BEIR、MLDR 基准上达到同级别 SOTA,并在 MIRACL 和 MTEB Code 上表现优异。
- 训练数据:将验证过的英文数据集翻译为 8 种语言,构建了包含 28 亿对数据的跨语言训练集。
- 泛化能力:mLateOn 展现出强大的零样本能力,在未见过检索训练的 13 种语言(如中日韩)上依然保持竞争力。
- 完全开源:模型、数据集和训练代码全部以 Apache 2.0 协议开源。
所属事件:LightOn 完全开源多语言检索模型及 28 亿对训练数据(11 条相关)→
「模型」频道最新
- 多语言检索新突破:307M参数模型推动帕累托前沿 — IgorCarron · 2026-07-31
- CrisperWhisper2.0 上榜 HF:高精度逐字转写与词级时间戳 — nyralabs · 2026-07-31
- 开发者实测:把 Claude Opus 当作不可控的疯狂 Agent 效果更好 — brandon_galang · 2026-07-30
- Kimi K3 架构深度解析:Together AI 联合举办技术对谈 — togethercompute · 2026-07-30
- Gemini ER 2 具身推理评测全面超越 Claude Opus 与 Sol — Zergylord · 2026-07-30
- Gemini 机器人模型实测:精准拆解9分钟挖掘机视频 — DynamicWebPaige · 2026-07-30