将文档预编译为KV缓存:SemPIC大幅削减RAG推理成本
TheTuringPost · x · 2026-08-06
arXiv 论文 SemPIC: Learning Semantic Position-Independent KV Caches 提出了一种优化 RAG 推理成本的新思路:将可复用文档视为编译好的推理产物(即位置无关的 KV 缓存),在不同请求间直接复用。
- 工作原理:通过一个带 LoRA 的“写入器”离线生成位置无关的分层 KV 缓存,基础模型(“读取器”)无需重新计算原始文档 token,即可直接读取并组合这些缓存。
- 解决痛点:传统 RAG 需要反复处理原始文本,而现有的前缀缓存无法适应位置变化。SemPIC 解决了 KV 缓存不可移植的问题。
- 实验效果:在 Llama-3.1-8B 和两个 Qwen3 模型上的测试显示,SemPIC 的平均 micro-F1 达到 0.60,接近完全重新计算的 0.62,远超此前缓存方法的 0.53。
- 局限:每个模型和领域仍需单独训练适配器。
所属事件:SemPIC提出文档预编译KV缓存以削减RAG成本(2 条相关)→
「Infra」频道最新
- AI智能体具备黑客能力,特定基础设施托管面临高风险 — tszzl · 2026-08-06
- TokenSpeed 调度器架构解析:C++ 控制面与 Python 执行面解耦 — zhyncs42 · 2026-08-06
- 马斯克:AI 算力每半年增 10 倍,传统数据中心将向 AI 转型 — r0ck3t23 · 2026-08-06
- Minimax H3 显存反直觉:分辨率越高反而占用越低? — gerentedesuruba · 2026-08-06
- SpaceX二季度扩大采购Tesla Megapack,为AI数据中心供电 — Scobleizer · 2026-08-06
- 将文档预编译为KV缓存:SemPIC大幅削减RAG推理成本 — TheTuringPost · 2026-08-06