PUMA:通用多模态嵌入后置稀疏化,检索快 25 倍
_reachsumit · x · 2026-08-27
PUMA 提出一种通过 TopK 自编码器对冻结的多模态嵌入进行后置稀疏化的方法,无需重新训练骨干网络。该方法先保留密集点积几何结构,再微调稀疏编码器以优化检索。在 Qwen3-VL-Embedding-2B 等模型上的实验显示,PUMA 在五个基准测试中有四个表现优于密集检索,并将向量存储减少了 8-16 倍,在大规模候选集上的检索速度提升最高达 25 倍。
「Infra」频道最新
- GLM-5.3 Flash 登顶 OpenRouter,纯国产芯仅需 1% 价格 — jietang · 2026-08-27
- 现代数据中心水耗竟低于农田,无需外部水源 — prasanna_says · 2026-08-27
- 博主承认对英伟达数据理解有误 — EigenGender · 2026-08-27
- 英伟达数据为年化值,每季增 250 亿 — cis_female · 2026-08-27
- 英伟达 Q2 并未额外创造 1000 亿美元价值 — EigenGender · 2026-08-27
- 业界对 CPU 节点的兴趣近期显著回升 — Sethwinterroth · 2026-08-27