hpool实现灵活自适应的检索模型压缩

antoinechaffin 详细介绍了检索模型压缩方法 hpool 的技术特性与相关对比评估。该方法突破了传统固定压缩模式的局限,为模型部署提供了更丰富的性能与压缩权衡方案,并在与最新基线的对比中展现了竞争力。

关键细节与灵活性

hpool 允许在推理时直接在树状图(dendrogram)的任意位置切割,从而灵活设定压缩度。此外,作者提出可采用多预算训练策略(如针对 [4, 8, 16, 32, 64, 128, 300] 等多种压缩预算进行训练),使模型在任意压缩级别下都更易被池化。不过,若部署目标明确(如仅针对 r=32),专门训练在同等 λ 下可比多预算训练多保留 1.6% 的信息。

自适应文档压缩

由于不同文档的信息量与可压缩程度不同,hpool 支持对每篇文档进行自适应池化。其机制是通过动态设定每篇文档的预算,计算出达到平均目标预算所需的簇间距离阈值,避免了将所有文档强制压缩到相同 token 数的粗暴做法。

与 AGC 方法的对比与存疑

近期出现的 Attention-Guided Clustering(AGC)论文指出,通过注意力学习池化在未正则化模型上能获得比 hpool 更好的信息保留率。但 antoinechaffin 指出,在正则化模型上结论有所不同:在他们评估的 7 个 BEIR 数据集上,AGC 的平均保留率为 97.4%,略低于 hpool 的 97.9%。作者也提醒,由于两者的训练数据与规模不同,该结果不可直接比较。

2026-07-07 ~ 2026-07-07 · 5 条相关

一手来源