将文档预编译为KV缓存:SemPIC大幅削减RAG推理成本
TheTuringPost · x · 2026-08-06
SemPIC 提出了一种优化 RAG 推理成本的新思路:将可复用文档视为编译好的推理产物(即位置无关的 KV 缓存),在不同请求间直接复用。
- 工作原理:通过一个带 LoRA 的“写入器”离线生成位置无关的分层 KV 缓存,基础模型(“读取器”)无需重新计算原始文档 token,即可直接读取并组合这些缓存。
- 解决痛点:传统 RAG 需要反复处理原始文本,而现有的前缀缓存无法适应位置变化。SemPIC 解决了 KV 缓存不可移植的问题。
- 实验效果:在 Llama-3.1-8B 和两个 Qwen3 模型上的测试显示,SemPIC 的平均 micro-F1 达到 0.60,接近完全重新计算的 0.62,远超此前缓存方法的 0.53。
- 局限:每个模型和领域仍需单独训练适配器。
所属事件:SemPIC提出文档预编译KV缓存以削减RAG成本(2 条相关)→
「Infra」频道最新
- Minimax H3 显存反直觉:分辨率越高反而占用越低? — gerentedesuruba · 2026-08-06
- SpaceX二季度扩大采购Tesla Megapack,为AI数据中心供电 — Scobleizer · 2026-08-06
- RTX 5090 跑 MiniMax H3:8 秒 1080P 视频渲染需 12 分钟 — jefharris · 2026-08-06
- Uber称AI使用量翻四倍,单Token成本反降 — Scobleizer · 2026-08-06
- tinygrad 团队正构建 GPU 原生 RTOS 与着色器编译器 — mohbibi_ · 2026-08-06
- 求推荐:高效的 CPU Pinned Memory Pool 管理库 — StasBekman · 2026-08-06