DoPR 用可复用压缩文档前缀做 LLM 重排:延迟最高提速 8 倍
_reachsumit · x · 2026-09-04
arXiv 论文 DoPR 针对逐点式 LLM 重排器跨查询反复处理同一文档的冗余计算,提出压缩文档前缀框架:将查询无关的文档表示离线转换为压缩的前缀状态并预计算缓存,在线重排时只需处理查询和打分 token,文档信息由缓存的 prefix 状态提供。
在 TREC DL、BEIR、BRIGHT 上用 0.6B–8B 的 Qwen3 模型实验:在线文档侧显存最高降 8.0 倍,延迟最高提速 8.04 倍,同时保留全文档重排器平均 NDCG@10 的 97.1%–99.5%。
「研究」频道最新
- MIT 媒体实验室将办 ScienceClaw 黑客松,打造科学领域的智能体互联网 — ProfBuehlerMIT · 2026-09-20
- Schmidhuber 考古:1971 年 Ivakhnenko 已用 8 层网络建模经济 — SchmidhuberAI · 2026-09-20
- Qwen 研究员:人工标注数据可能比自动标注更噪 — antoine_chaffin · 2026-09-20
- 检索评测数据集隐患多,用 LLM 重标注旧数据成解法 — CShorten30 · 2026-09-20
- 北航团队提出 PhyFilter:仿真平地训练的机器人直接征服碎石路 — jiqizhixin · 2026-09-20
- ICLR 收稿暴涨 200% 至 6 万篇摘要,审阅需约 250 人年 — gleech · 2026-09-20