论文提出原生多模态架构 NEO:从零训练挑战视觉编码器
liuziwei7 · x · 2026-08-16
针对视觉语言模型(VLM)中视觉编码器的争议,新论文 "From Pixels to Words" 提出了原生 VLM 的构建原则,并发布了 NEO 模型系列。核心观点认为最好的 encoder 就是不需要 encoder,且从零训练(train from scratch)总是胜出。NEO 模型通过共享语义空间有效对齐像素和词表示,无缝整合视觉和语言模块,在 3.9 亿图像文本对上从零开始训练,显著缩小了与传统模块化顶级模型的差距。
「多模态」频道最新
- 首部 MiniMax H3 Ref2VA 动画作品展示 — NobodySnJake · 2026-08-16
- MiniMax H3 当多参考图编辑器,还能电子宠物点评生成 — RobbaW · 2026-08-16
- AI 生成《武则天传》音乐视频,36 镜头展示制作水准 — Hongyi_AI · 2026-08-16
- 实测 MiniMax H3:6 分钟生成 6 分钟动画 — dassiyu · 2026-08-16
- 用Minimax H3生成《疯狂动物城》同人视频:Clawhauser八卦Sonic恋情 — TigerClaw305 · 2026-08-16
- Seedance 2.5 上线 TapNow,支持原生 1080p 视频生成 — SimplyAnnisa · 2026-08-16