ColNanoVDR 免文档蒸馏多向量检索,149M 小模型保住 95% 检索精度

nanovdr · hf · 2026-09-29

视觉文档检索(VDR)的多向量检索器性能领先,但每次查询都要跑一个数十亿参数的查询编码器,成为瓶颈。标准的分数蒸馏做法需要编码并缓存所有训练页面,页面 token 可达 TB 级。

ColNanoVDR 声称是首个把「免文档蒸馏」引入多向量 VDR 的框架:只用教师模型的查询嵌入训练学生,完全不碰页面。其核心目标函数 OTW(带可学习权重的最优传输)用熵最优传输把学生的查询 token 与教师对齐,并为每个学生 token 学习权重,且不要求两边 tokenization 一一对应;论文证明了该对齐代价可约束每页上的 MaxSim 分差。

实验结果:从五个 SOTA 教师蒸馏出的 149M 纯文本学生模型,在 ViDoRe v1-v3 上保留教师约 95% 的 NDCG@5,查询编码速度最高快 26 倍;同等训练条件下 OTW 与分数蒸馏效果相当,却不需编码任何页面,读取的缓存教师数据少 12.6 倍。

所属事件:ColNanoVDR 免文档蒸馏训练多向量视觉检索,编码提速 26 倍(2 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →