NeoMME:单塔多模态多语言编码器,260M 版检索成绩超同级模型
CShorten30 · x · 2026-09-03
论文提出 NeoMME,一个 260M 与 800M 参数的多模态原生多语言编码器家族:用单个双向 Transformer 同时处理多语言文本 token 和原始图像 patch,无需预训练视觉塔、文本编码器或解码器,以掩码离散扩散文本目标从零预训练。
- 支持 16,384 token 上下文,足够编码两张 4K UHD 图像
- 微调出密集 + late-interaction 检索头后,NeoMME-Retriever 260M 在 ViDoRe v3 上以 0.523 nDCG@10 超过所有 800M 以下模型,800M 版达 0.556
- 在 L40S 上以 2048x2048 输入对比,260M 版编码页面吞吐约为 ColModernVBERT 的 2 倍
- 层级 token 池化与非对称量化可压缩 late-interaction 多模态文档嵌入,降低检索成本
所属事件:LightOn 发布 NeoMME 单塔多模态编码器,小参数量领跑检索(3 条相关)→
「多模态」频道最新
- ComfyUI 浏览器端跑重视频工作流频繁崩溃,作者迁移至桌面端 — Suspicious_Pizza9529 · 2026-09-03
- Seedance 2.5 复刻快银名场面,视频生成再秀肌肉 — bennash · 2026-09-03
- AI 一镜到底 30 秒穿越阿尔及利亚:从卡斯巴哈到撒哈拉星空 — azed_ai · 2026-09-03
- 作者用 MiniMax H3 为 Suno AI 音乐制作 MV 实测 — Velkan1642 · 2026-09-03
- MiniMax-H3 推出 int8 融合量化版,主打 ComfyUI 单文件视频生成 — MATLOWAI · 2026-09-03
- Reddit 作者分享 AI 动画工作流:给角色定义语音特征是成败关键 — dassiyu · 2026-09-03