Linkup 开源稀疏检索模型 SparseUp,BEIR-13 登顶
Linkup Research(LightOn 旗下)开源了稀疏嵌入模型 SparseUp,许可证为 Apache 2.0,补齐了 DenseOn、LateOn 之外缺失的稀疏检索拼图。模型参数量不足 150M,基于 ModernBERT(约 1.4 亿参数量级),在 BEIR-13 基准上取得 56+ nDCG@10,被描述为该规模下已知最强的稀疏检索模型。
已确认
- 模型由 Linkup Research 发布,权重开放,许可证 Apache 2.0(m1、m2)
- 参数量 <150M,骨干为 ModernBERT(m1、m2)
- BEIR-13 上 56+ nDCG@10,为已知同规模最强(m1、m2)
- 模型名为 linkup-sparseup-embed-v1(m5)
- Sentence Transformers 维护者 tomaarsen 高调点赞并发布配套支持(m2、m5)
配套科普与生态支持
tomaarsen 在发布线程中科普稀疏嵌入模型:向量维度通常等于词表大小,约 99% 的位置为 0,只有少数激活维度(SPLADE 类方法)。稀疏性带来两大好处:存储只需保存非零项因而便宜,且激活维度对应具体词元、可解释性强(m3、m4)。
生态方面,Sentence Transformers 新增 SparseEncoder 接口,SparseUp 完全兼容,稀疏嵌入几行代码即可上手(m5)。
为什么重要
- 开源 + 小参数量 + BEIR 领先成绩,降低了生产级稀疏检索的采用门槛
- 主流框架(Sentence Transformers)第一时间提供原生支持,说明社区认可度较高
- 稀疏检索在存储成本与可解释性上相对稠密向量有独特优势,此前开源选择较少
2026-09-17 ~ 2026-09-17 · 6 条相关
一手来源
- Linkup 开源 SPARSEUP:<150M 参数登顶 BEIR-13 稀疏检索,Apache 2.0 — antoine_chaffin ·
- Linkup 开源 SparseUp 稀疏检索模型:150M 以下 BEIR 最强 — tomaarsen ·
- Sentence Transformers 推出 SparseEncoder:稀疏嵌入几行代码上手 — tomaarsen ·
- 【源头】Linkup 开源 SPARSEUP:<150M 参数登顶 BEIR-13 稀疏检索,Apache 2.0 — antoine_chaffin · 2026-09-17
- 【源头】Linkup 开源 SparseUp 稀疏检索模型:150M 以下 BEIR 最强 — tomaarsen · 2026-09-17
- 什么是稀疏嵌入模型:维度等于词表大小,99% 为零 — tomaarsen · 2026-09-17
- 稀疏嵌入模型解析:99% 维度为零,存储便宜还可解释 — tomaarsen · 2026-09-17
- 【源头】Sentence Transformers 推出 SparseEncoder:稀疏嵌入几行代码上手 — tomaarsen · 2026-09-17
- Linkup 开源 SPARSEUP:150M 稀疏检索模型 BEIR-13 得 56+ — antoine_chaffin · 2026-09-17