DoPR 用可复用压缩文档前缀做 LLM 重排:延迟最高提速 8 倍

_reachsumit · x · 2026-09-04

arXiv 论文 DoPR 针对逐点式 LLM 重排器跨查询反复处理同一文档的冗余计算,提出压缩文档前缀框架:将查询无关的文档表示离线转换为压缩的前缀状态并预计算缓存,在线重排时只需处理查询和打分 token,文档信息由缓存的 prefix 状态提供。

在 TREC DL、BEIR、BRIGHT 上用 0.6B–8B 的 Qwen3 模型实验:在线文档侧显存最高降 8.0 倍,延迟最高提速 8.04 倍,同时保留全文档重排器平均 NDCG@10 的 97.1%–99.5%。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →