149M参数刷新BEIR纪录,LightOn开源多语言检索模型
_reachsumit · x · 2026-07-30
LightOn 团队近期发布了一项完全开源的检索模型训练方案,旨在消除当前 SOTA 模型因依赖闭源数据而造成的复现鸿沟。
- 数据与模型:研究者从 34 个公共来源中清洗重构了 6.65 亿对英文对比预训练数据,并构建了包含难负样本的微调数据集。基于此训练出 149M 参数的 DenseOn(单向量密集模型)和 LateOn(ColBERT 风格的后期交互模型)。
- 性能表现:这两个轻量级模型在 BEIR 基准上分别取得了 56.20 和 57.22 的平均 nDCG@10 成绩,刷新了同等参数量级下的 SOTA 纪录。
- 多语言泛化:通过将英文数据翻译成 8 种语言,团队进一步训练了 307M 参数的多语言版本。实验发现了一个有趣的现象:尽管共享主干网络,密集模型在未受翻译训练支持的语言上性能会显著下降,而后期交互模型则凭借 token 级别的匹配机制,展现出了更优秀的跨语言泛化能力。
所属事件:LightOn 完全开源多语言检索模型及 28 亿对训练数据(11 条相关)→
「研究」频道最新
- LLM 推理提效实为“过训练”?掩码蒸馏机制深度解析 — rao2z · 2026-07-31
- AI生图检测准确率降至38%,人类视觉图灵测试引关注 — saheedniyi_02 · 2026-07-31
- 深度思考:强大的 AI 数学工具可能没想象中那么颠覆 — rbhar90 · 2026-07-31
- ICLR 2027 新规:限制作者提交数量以防范学术刷榜 — JessicaHullman · 2026-07-31
- Nature 研究:国家媒体控制会显著影响大模型倾向 — steverathje2 · 2026-07-31
- PWT 稀疏注意力新法:无需微调,视频生成端到端提速 2.5 倍 — 青稞AI · 2026-07-31