从零训练多模态编码器 NeoMME:260M/800M 无视觉塔,主打快

CShorten30 · x · 2026-09-03

Tony Wu 与 Aurélien Lucet 发布 NeoMME:不依赖大规模生成式 VLM 起步,而是从零训练的原生文本+图像编码器,260M 与 800M 两个规格,无 vision tower,多语言且以速度为设计目标。还基于其微调了视觉文档检索器 NeoMME-Retriever。附带可在线试玩的 demo,LFM2.5-VL-450M 被用作其中的 VLM 组件。

所属事件:LightOn/H 发布 NeoMME 单塔多模态编码器(5 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →