NeoMME 单塔多模态编码器:260M 参数在 ViDoRe v3 领跑 800M 以下模型
_reachsumit · x · 2026-09-03
论文提出 NeoMME,一系列 260M/800M 参数的多模态多语言双向编码器,在单个 Transformer 中处理多语言文本与原始图像 patch,无需分离预训练的视觉编码器。采用掩码离散扩散文本目标从零预训练,支持 16384 token 上下文(可编码两张 4K 图像)。
检索性能:微调后 NeoMME-Retriever 260M 在 ViDoRe v3 达 0.523 nDCG@10,800M 版本达 0.556,均超过所有 800M 参数以下的参评模型;在 L40S 上 260M 版本编码吞吐约为 ColModernVBERT 的 2 倍,并通过层级 token 池化与非对称量化压缩 late-interaction 嵌入。模型已开源。
「多模态」频道最新
- 开源项目 UNREEL:边看边生成的 AI 视频流媒体,渲染快过播放 — EAccelerate_42 · 2026-09-03
- ComfyUI 工作流:双参考图生成三视图角色设定表 — Sea-Advantage-4063 · 2026-09-03
- RTX 5090 本地生成 FF7 大战巴哈姆特片段,耗时仅 20 分钟 — SX2k7 · 2026-09-03
- SEEDANCE 2.5 实测:一段完整提示词生成以假乱真的深夜健身房 Vlog — SimplyAnnisa · 2026-09-03
- SEEDANCE 2.5 实测:完整 prompt 生成以假乱真的深夜健身房 Vlog — SimplyAnnisa · 2026-09-03
- MiniMax H3 提示词走红:让任何图片生成「从零手工制作」幕后视频 — Hailuo_AI · 2026-09-03