论文提出原生多模态架构 NEO:从零训练挑战视觉编码器

liuziwei7 · x · 2026-08-16

针对视觉语言模型(VLM)中视觉编码器的争议,新论文 "From Pixels to Words" 提出了原生 VLM 的构建原则,并发布了 NEO 模型系列。核心观点认为最好的 encoder 就是不需要 encoder,且从零训练(train from scratch)总是胜出。NEO 模型通过共享语义空间有效对齐像素和词表示,无缝整合视觉和语言模块,在 3.9 亿图像文本对上从零开始训练,显著缩小了与传统模块化顶级模型的差距。

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →