层级池化技术实现晚期交互检索模型5倍无损压缩

近期,研究者antoinechaffin针对ColBERT等晚期交互检索模型存储与算力开销过大的痛点,提出了一种名为“层级池化”的压缩方法。该方法通过对文档嵌入进行层级聚类并迭代合并最近的簇,能够显著降低大规模检索系统的存储与部署成本,且该思路可推广至多种模态。

关键细节与技术演进

层级池化技术经历了一定演进。最初,LightOn宣布引入该方法实现了对ColBERT模型状态的2倍无损压缩。随后,antoinechaffin进一步探索了针对该方法的正则化训练(或称k-means池化感知微调)。@reachsumit 的总结指出,这种轻量级微调使得模型在大幅压缩向量的同时实现零准确率损失。具体数据表明,在32 token压缩下,模型留存率从无正则训练时的77%大幅飙升至99.4%,实现了近乎无损的5倍压缩,且未损害全token性能。作者表示,该方法未来仍有大量改进空间。

2026-07-07 ~ 2026-07-08 · 6 条相关

一手来源