awesome-multivector-retrieval now tracks 50+ datasets across 17 corpora and 8 encoders

CShorten30 · x · 2026-09-29

The community-maintained awesome-multivector-retrieval repo keeps growing: after Silvio Martinico published 9 multivector datasets last week, Robro612 added 40+ more on Hugging Face. The repo now lists 50+ ready-to-use datasets spanning 17 corpora and 8 encoders.

The repo is an annotated resource list for late-interaction multivector retrieval, covering foundational models (ColBERT, COIL), compression and token pruning, multimodal/vision models, indexing and search algorithms, scoring kernels, software libraries and training/inference frameworks, model checkpoints, and datasets/encodings such as NFCorpus, SciFact, MS MARCO and ViDoRe.

Original post →

More from Research

Research channel →