VisCo 复用预训练 VLM,实现更强的视觉 token 压缩
Yupeng Zheng · hf · 2026-07-27
- VisCo 研究的是 VLM 的视觉 token 压缩,目标是降低推理延迟和显存开销。
- 它不是额外加一个压缩模块,而是直接复用预训练 VLM 本身作为内在压缩器。
- 方法上,VisCo 是一个参数共享的自编码器:用少量 memory tokens 压缩视觉信息,并在编码/解码之间传递层级信息。
- 实验显示,它在所有测试压缩率上都优于已有方法,且在更激进的压缩场景下优势更明显。
- 即使压到单 token,它也能保持稳定;把学到的 memory tokens 与原始视觉 token 结合时,还能反过来提升基础模型表现。
「研究」频道最新
- CellType 在 YC Startup School 展示生物世界模型 — david_van_dijk · 2026-07-27
- SceneActBench 评测 VLM Agent 是否能在完整 3D 场景中行动 — Yifei Zhao · 2026-07-27
- 腾讯混元梳理原生多模态预训练的缩放规律 — Tencent-Hunyuan · 2026-07-27
- 无需训练的生成渲染方法修复回访场景不一致 — Wenchao Ma · 2026-07-27
- NVIDIA 开源 Molt:面向 Agentic 强化学习的训练框架 — nvidia · 2026-07-27
- Skill Self-Play 用共进化技能提升 LLM 能力上限 — QwenBusinessUnit-Edu · 2026-07-27