REVA 挖掘 LLM 历史注意力构建可复用证据视图,RAG 压缩开销降 5-15 倍

_reachsumit · x · 2026-09-11

RAG 长上下文会推高延迟、KV cache 显存与 token 成本,而现有检索后压缩器逐查询独立运行,在线开销可能抵消短 prompt 的收益。

论文 REVA 换了个数据挖掘视角:把历史「查询-文档-模型」交互聚合成可复用的证据视图——

在 4 个基准与现代 LLM 上,生成质量较现有方法提升 1.0-5.8 分,压缩开销降低 5.3-15.6 倍,额外延迟不足 40ms。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →