AdaptiveEmbed: Sample-Adaptive Multi-Vector Representation for Multimodal Retrieval
Xinze Liu, Lei Yang, Dayan Wu, Hengjie Zhu, Zihao Zhang, Hanqi Wu, Tianzhu Hu, Peng Fu, Zheng Lin, Weiping Wang
cs.CV
2026-08-26
AdaptiveEmbed 按样本分配多向量容量:平均 2.1 个 token 在 COCO 上做到 63.45/61.14 mAP,超过同框架下 3 到 40 个 token 的固定预算,也超过若干单向量大模型。
多向量检索已经从 ColBERT 的 token 级 MaxSim 走到 ColPali、MetaEmbed 这类视觉多向量。大家争论的是向量怎么造、怎么比,容量却几乎按系统一刀切:所有样本同一套 k,或者最多在推理时选一个全局工作点。
作者先做了一个 oracle:每条样本有自己最合适的 k,而且最优 k 铺满了整个可选范围。表面内容复杂度并不能预测这条样本到底需要多少容量,真正该看的是「再加一条向量对检索有没有用」。于是他们把问题写成 SAMVR:容量是样本级决策变量,得到的表示叫内容自适应嵌入集。
AdaptiveEmbed 分两段。第一段用 Q-Former 产出固定 8 个候选 token,再按两组前缀做 Multi-Group Contrastive Learning。每组有一个粗粒度锚和若干细粒度补充,短前缀是紧表示,长前缀往上叠细节。相似度不用 MaxSim,改用对称的 SetSim:等基数的两个集合做最大权一对一匹配,平均相似度作为分数。这样同一套嵌入既能当 query 也能当 gallery,双向检索不用准备两套角色。
第二段决定这条样本用哪些 token。Token Selection Transformer 看当前已选集合、可扩展的下一个前缀、以及检索银行上的 MaxSim 反馈,每步选择「再加一个」或停。训练时穷举所有合法动作的边际 AP,标准化后当效用,直接优化策略的期望效用,不走采样式 policy gradient。推理时从最小前缀出发,扩展概率掉到阈值 δ 就停。可达配置只有 1、2、4、8 五种容量,决策被收成三步层级,避免组合爆炸。
图像-文本四个数据集、全库一对一 mAP。COCO 上 AdaptiveEmbed 平均 2.1 个 token,T2I/I2T 为 63.45/61.14;同框架 MetaEmbed 从 3 个 token 的 62.31/60.48 到 40 个 token 的 62.27/59.12,加容量几乎不涨。Qwen3-VL-Embedding-8B 单向量是 50.20/49.52。OpenImages 图库超过 54.6 万,AdaptiveEmbed 两边都最高。Flickr30K 的 I2T 是例外:AdaptiveEmbed 75.72,MetaEmbed (2/4) 是 77.24,八个方向里它赢六个。
视频和音频同构。ActivityNet 平均 1.9 个 token,T2V/V2T 61.62/56.48,压过同框架 MetaEmbed,但单向量 Qwen3-VL-Embedding-8B 做到 66.26/57.48,更大的视觉编码器在视频上仍更强。Clotho 音频 32.56/31.75,超过 WAVE-7B 的 30.65/28.47。oracle 在相近容量上还能再涨一大截:COCO 到 69.51/67.85。去掉 MGCL 或银行反馈都会掉点,后者平均 token 还升到 2.5,多向量补不回缺失的检索反馈。
多向量检索的账单在匹配时间和存储,不在「再多几条向量一定更准」。按样本停在两条左右,匹配成本远低于 16/64 那种固定大集合。MetaEmbed 被放进同一套 Stage-I 训练,对照干净:差的是分配策略,不是骨干。做图文检索、想压 late-interaction 开销的人,可以直接把「每条样本自己决定 k」当成新旋钮。
它还没有赢过所有单向量巨模型。视频上 Qwen 8B 仍然更高,说明自适应容量救的是多向量预算,不是任意 backbone。
学到的策略和 oracle 之间还有明显缝:COCO T2I 63.45 对 69.51。层级三步、五种终态,覆盖不了中间配置。作者也写了,粗决策够用的 MaxSim 银行反馈,到更细的配置上会迅速变弱。
评测是一对一全库 mAP,每条 query 只有一个正例,和 COCO 五描述、常规 Recall@K 协议不同。所有基线按这个协议重评了,但和文献里常见数字不能直接横跳。Flickr I2T 输给 MetaEmbed (2/4),说明自适应不是每个方向都占优。银行反馈在训练时用了检索效用当目标,部署时银行与线上分布一偏,策略可能跟着偏。效率优势来自平均容量低,难样本占多数时,速度红利会收窄。