从零训练多模态编码器 NeoMME:260M/800M 无视觉塔,主打快
CShorten30 · x · 2026-09-03
Tony Wu 与 Aurélien Lucet 发布 NeoMME:不依赖大规模生成式 VLM 起步,而是从零训练的原生文本+图像编码器,260M 与 800M 两个规格,无 vision tower,多语言且以速度为设计目标。还基于其微调了视觉文档检索器 NeoMME-Retriever。附带可在线试玩的 demo,LFM2.5-VL-450M 被用作其中的 VLM 组件。
所属事件:LightOn/H 发布 NeoMME 单塔多模态编码器(5 条相关)→
「研究」频道最新
- 15.9M 参数 OCR 专用模型 Kraken 击败大数百倍 VLM — vanstriendaniel · 2026-09-03
- Ben Recht 课堂实录:从历史频率到未来概率的预测数学 — beenwrekt · 2026-09-03
- 2.6B 小模型登顶逆合成 SOTA,Insilico 开源 MMAI Gym — helloiamleonie · 2026-09-03
- 「持续学习」需要更好的分类学:五种机制的拆解 — Typical-Scene-5794 · 2026-09-03
- SupraLabs 开源 5M 参数 GatedDeltaNet,2B tokens 数据对标社区模型 — LH-Tech_AI · 2026-09-03
- Nature Medicine 刊文质疑「通用 LLM 胜过临床 AI 工具」结论 — anshulkundaje · 2026-09-03