分层 token 池化让多向量索引减半,性能几乎无损

tomaarsen · x · 2026-08-18

多向量检索的痛点是索引膨胀:4,874 篇 Natural Questions 文章会变成 608,414 个 token 向量、311.5 MB,约为 1024 维 dense 索引(约 20 MB)的 16 倍。Clavié、Chaffin 与 Adams 提出的 HierarchicalTokenPooling 用 Ward 层次聚类压缩每个文档的 token 向量,只保留约 1/poolfactor;poolfactor=2 时索引减半,仍保持未池化 BEIR 性能的 100.6%,可按次调用、独立使用或直接烘进模型。另两条出路:真正的晚交互索引,或把多向量模型当 reranker 用。

所属事件:Sentence Transformers v6.0 发布,晚交互多向量模型成一等公民(33 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →