REVA 挖掘 LLM 历史注意力构建可复用证据视图,RAG 压缩开销降 5-15 倍
_reachsumit · x · 2026-09-11
RAG 长上下文会推高延迟、KV cache 显存与 token 成本,而现有检索后压缩器逐查询独立运行,在线开销可能抵消短 prompt 的收益。
论文 REVA 换了个数据挖掘视角:把历史「查询-文档-模型」交互聚合成可复用的证据视图——
- 先指出主流压缩器相对简单截断的收益不稳定,还会引入显著推理延迟;
- 再把生成器的历史注意力痕迹挖掘成按文档索引、与预算无关的分数库,将 token 级注意力映射到可读词单元并跨重复访问聚合;
- 按预算渲染保留文档顺序、兼容标准 RAG 接口的纯文本视图。
在 4 个基准与现代 LLM 上,生成质量较现有方法提升 1.0-5.8 分,压缩开销降低 5.3-15.6 倍,额外延迟不足 40ms。
「Infra」频道最新
- 网页 demo 近似复现 V4.1 flash 的 KV 快速预填充,跑在 Qwen3 上 — T_rex2700 · 2026-09-11
- OpenAI CFO:一年前买的算力如今市场价涨 3-5 倍,但仍然不够用 — rwang07 · 2026-09-11
- Edge0-35B-A3B 预览版登 HF 热榜,主打边缘推理与 MoE 架构 — Edge0 · 2026-09-11
- Reflect Orbital 拟用卫星镜面「卖阳光」,首发卫星待发射 — kyliebytes · 2026-09-11
- 数据中心不是给巨头建,而是让初创公司有机会竞争 — arthurcolle · 2026-09-11
- KV缓存9个月压缩54倍,DeepSeek被称第三前沿实验室 — max_paperclips · 2026-09-11