ReToken 用单个可学习 embedding 提升长上下文视觉检索
burkov · x · 2026-08-04
伊利诺伊大学、微软研究院和 Google DeepMind 合作提出了 ReToken:一个轻量级、单个可学习的 embedding,用来增强视觉语言模型在长上下文里检索相关视觉 token 的能力。
- 它重点解决的是:模型在长图像/视频上下文中,如何更准确找到和问题相关的视觉信息。
- 论文称其在图像和视频基准上都有显著提升。
- 同时它保持了计算开销较低,不是靠单纯堆算力换结果。
「多模态」频道最新
- RTX 3060 12G 实测:17 分钟本地生成 10 秒竖屏视频 — merica420_69 · 2026-08-04
- 告别乱连线:ComfyUI 节点输出可视化调试工具发布 — niknah · 2026-08-04
- 字节跳动 Douyin 多模态 embedding 模型拿到 MMEB-v2 SOTA — _reachsumit · 2026-08-04
- 一支 Prompted 科幻恐怖短片主打黑暗诡异氛围 — MovitoirStudios · 2026-08-04
- LeapTalk 单步生成说话头视频,速度最高达 200 FPS — Shanghai-Jiao-Tong-University-SAI · 2026-08-04
- 无模态区分的生成式推荐器,从图像和文本学同一个 tokenizer — _reachsumit · 2026-08-04