NTU与商汤提出原生统一视觉模型NEO-ov

jiqizhixin · x · 2026-07-05

NTU 与商汤研究院(SenseTime Research)提出 NEO-ov,一种原生(native)统一视觉模型,端到端学习像素与文字的对应关系,无需外部编码器或融合技巧。该模型在标准任务上匹敌模块化模型,并在单图、多图和视频的细粒度视觉感知上表现突出,证明原生架构在大规模下具有竞争力。已放出论文与代码。

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →