NeoMME 单塔多模态编码器:260M 参数在 ViDoRe v3 领跑 800M 以下模型

_reachsumit · x · 2026-09-03

论文提出 NeoMME,一系列 260M/800M 参数的多模态多语言双向编码器,在单个 Transformer 中处理多语言文本与原始图像 patch,无需分离预训练的视觉编码器。采用掩码离散扩散文本目标从零预训练,支持 16384 token 上下文(可编码两张 4K 图像)。

检索性能:微调后 NeoMME-Retriever 260M 在 ViDoRe v3 达 0.523 nDCG@10,800M 版本达 0.556,均超过所有 800M 参数以下的参评模型;在 L40S 上 260M 版本编码吞吐约为 ColModernVBERT 的 2 倍,并通过层级 token 池化与非对称量化压缩 late-interaction 嵌入。模型已开源。

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →