UltraViT 为端侧 LVLM 重做视觉编码器,速度提升 1.7 倍
SamsungResearch · hf · 2026-07-29
UltraViT 盯住端侧 LVLM 的视觉编码瓶颈
Samsung Research 提出 UltraViT,这是一个专门为端侧部署的视觉语言大模型设计的视觉编码器,而不是把视觉骨干当成通用重负载模块来用。
- 论文指出,现有压缩 LVLM 的工作大多聚焦在 减少视觉 token 或 缩小语言模型,但真正被忽视的往往是 vision encoder 本身。
- UltraViT 采用了一个 金字塔式架构,在 macro-block 级别融合不同类型的空间混合器,并且设计时直接参考了真实设备上的延迟。
- 预训练方面,作者提出了 两阶段生成式预训练:先用 dense distillation 学习丰富的空间特征,再用冻结的、容量混合的 LLM 做直接生成监督。
- 论文认为,这种做法比传统的对比学习和 SSL 更适合为后续 LVLM 的生成式多模态对齐打基础。
- 实验显示,UltraViT 在效率 LVLM 编码上达到新的最佳结果,在端侧运行速度约比已有 encoder 基线 快 1.7 倍。
「研究」频道最新
- CHORUS 预告单一 VLA 让多机器人分散协作 — chris_j_paxton · 2026-07-29
- OpenAI 称编程智能体已能接手科研维护、重写与新系统 — OpenAI · 2026-07-29
- Allen AI 地球观测平台测绘北美野火风险,并行提速 155 倍 — allen_ai · 2026-07-29
- 研究发现大模型混合数学与代码时易产生幻觉 — Round_Apple2573 · 2026-07-29
- 新博客质疑 KV cache 只是 LLM 持续心智的表象 — birchlse · 2026-07-29
- 学者探讨开源权重模型面临的安全与技术挑战 — StephenLCasper · 2026-07-29