PUMA:通用多模态嵌入后置稀疏化,检索快 25 倍

_reachsumit · x · 2026-08-27

PUMA 提出一种通过 TopK 自编码器对冻结的多模态嵌入进行后置稀疏化的方法,无需重新训练骨干网络。该方法先保留密集点积几何结构,再微调稀疏编码器以优化检索。在 Qwen3-VL-Embedding-2B 等模型上的实验显示,PUMA 在五个基准测试中有四个表现优于密集检索,并将向量存储减少了 8-16 倍,在大规模候选集上的检索速度提升最高达 25 倍。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →