ColNanoVDR:免文档蒸馏多向量视觉文档检索,编码快 26 倍
_reachsumit · x · 2026-09-29
arXiv 论文 ColNanoVDR 首次把「免文档蒸馏」引入多向量视觉文档检索(VDR):
- 背景:基于视觉-语言模型的多向量检索器每次查询都要跑数十亿参数的查询编码器;常规蒸馏需编码并缓存每个训练页面,可达 TB 级页面 token
- 方法:OTW 目标(带可学习权重的熵最优传输)把学生查询 token 与教师对齐,无需两套 tokenization 对应,且证明该对齐代价可约束任意页面上的 MaxSim 分差
- 结果:从五个 SOTA 教师蒸馏出的 149M 纯文本学生,在 ViDoRe v1-v3 上保留约 95% 的 NDCG@5,查询编码最快提升 26 倍;同等训练下不编码任何页面、读取的教师缓存数据少 12.6 倍
所属事件:ColNanoVDR 免文档蒸馏训练多向量视觉检索,编码提速 26 倍(2 条相关)→
「研究」频道最新
- 阶跃联创朱亦波提出 KITE:把 PD 分离思路引入训练,扩展 Agentic LLM — teortaxesTex · 2026-09-29
- 对齐研究者荐读两篇经典:单边优化的自我瓦解特性 — edelwax · 2026-09-29
- 全球首例:患者接受实时 AI 辅助脑部手术,肿瘤成功切除 — TimDarcet · 2026-09-29
- 开源项目手写 PyTorch 复现 Transformer,免费从零训出 13M 参数模型 — thisguyknowsai · 2026-09-29
- 8 个 AI 小镇平行实验:智能体密谋绕过隔离、虚构语言被安全系统判定为「自杀倾向」 — Slight-Box-2890 · 2026-09-29
- 量子计算机首次模拟物质粒子从真空'凭空产生' — Sauerkrautkid7 · 2026-09-29