NeoMME: A Single-Tower Multimodal-Native Multilingual Foundation Encoder for Efficient Fine-Tuning and Inference
Aurélien Lac, Tony Wu
cs.IR, cs.AI, cs.CV
2026-08-31
从零训练 260M 与 800M 单塔双向编码器做视觉文档检索,图文共享同一 Transformer。ViDoRe v3 上 nDCG@10 分别为 0.523 与 0.556,页面索引吞吐约是 ColModernVBERT 的两倍。
视觉文档检索常把生成式 VLM 改成编码器:预训练视觉塔加上因果语言模型,非生成任务却背着生成模型的参数和算力。ColPali 这条线把页面当图做 late-interaction,ModernVBERT 把解码器换成双向编码器,但 SigLIP2 视觉塔还在。双塔和「视觉塔+语言模型」让两个模态走不一样的计算路径,预训练、微调和 serving 也拆成两套生命周期。
NeoMME 的立场是:检索这种非生成任务,应该用为表征训练的双向单塔,图块和文本从第一层就进同一个 Transformer。
260M 和 800M 两个规格都从随机初始化训起。文本走 ALBERT 式因子化词表(256 维再投影);图像切成 32×32 RGB patch,LayerNorm 加两层 MLP 映到隐空间,没有预训练 ViT,也不做 patch merging。最长上下文 16,384,按 32 像素切块大约能塞两张 4K 图。多数层是对称滑动窗口(半窗在 256 和 1024 间交替),每第六层和最后一层全局注意力,并配 2D RoPE、GQA、QK-Norm。
预训练是文本上的掩码离散扩散:只在被掩位置算损失,图像 patch 保持可见并作为条件。纯文本段的掩码率从 U(0,1) 抽;图文段从 U(0.30,1) 抽,逼模型少靠可见文字、多看图。计划数据约 5240 亿 packed token,文本流 55%、多模态流 45%,50 万步。
检索微调在同一 backbone 上并训两个头:128 维 late-interaction(MeanMaxSim)和 Matryoshka 稠密向量。一次前向两个都能出。作者还做了融合 MaxSim 的 LIK 核,4096 文档 token 时把峰值显存从 672MB 打到 193MB。
ViDoRe 只报 v3 的 8 个公开任务。Late-interaction 的 nDCG@10:260M 为 0.523,800M 为 0.556。260M 在所有严格小于 800M 的对照里最高,相对各基准上最好的其他 <300M 模型,v3/v2/v1 分别高 26.1、11.5、5.4 个点。0.523 距 3.75B 的 ColQwen2.5 不到 0.2 个点,参数量小约 14.4 倍。800M 比 ColQwen2.5 高 3.2 个点,距约 850M 的 Vultron Flash 不到 0.9 个点。
相对 ColModernVBERT:v2 上 0.5505 vs 0.4364,v1 上 0.8666 vs 0.8177。BEIR-15 上 late-interaction 比 dense 高 18.3(260M)和 14.4(800M)个点,800M late-interaction 为 0.513。NVIDIA L40S、2048×2048 时 260M 索引 51.3 页/秒,ColModernVBERT 为 26.0,约 1.97 倍。层次 token pooling(因子 8)加非对称量化(query int8、文档 binary),把 260M 的多向量从每页约 1.5MB 压到 6kB,255 倍,并保住基线 nDCG@10 的 95% 以上。
90% 掩码时,可见页面 patch 把掩码 token 准确率分别抬高 38.4(260M)和 40.5(800M)个百分点,说明预训练确实在用图。
对 Visual RAG,这提供一个不必背 VLM 解码器的页面编码器,Apache 2.0,已进 Hugging Face Transformers。260M 在小模型区把质量和吞吐同时推上去,255 倍压缩让 late-interaction 存大语料变得现实。它不是通用视觉塔:冻结的自然图 16-shot 平均准确率只有 13.2,文档任务(RVL-CDIP 微调 6000 条到 81.5)才是它的舒适区。
预训练文本量大约 2900 亿,ModernBERT 约 2T,差一个数量级。没有图像重建或图像级对比损失,弱自然图探针很可能来自这个选择。检索监督远小于 mLateOn(约 43 万纯文本 query vs 6.6 亿对比对),BEIR 差距有多少来自数据规模说不清。图文混合语料能排,但 UniDoc-Bench、MixBench 没跑。架构、数据、目标没有匹配消融,260M 的领先有多少来自「去掉视觉塔」无法归因。视觉检索的语言覆盖也窄。