REFRAG 让 KV 缓存跨 prompt 复用,但 16x 压缩也救不了「全库进上下文」
CShorten30 · x · 2026-10-05
CShorten30 在 podcast 讨论中澄清了 prompt caching 与向量数据库的关系,并讨论了 REFRAG 的思路:
- prompt caching 复用的是模型的 KV 状态,且只对精确前缀生效——改一个 token 或调整检索文档顺序,缓存即失效。
- REFRAG 的做法:为每个文档块预计算一个 embedding,使其可以在任意 prompt、任意顺序下复用,突破前缀限制。
- 但即便 16 倍压缩也不意味着「把整个数据库塞进上下文」可行:100 万篇文档、每篇约 500 token 即 5 亿 token,压缩后仍有约 3100 万 token——检索仍然不可或缺。
完整讨论见其围绕 Sparse Attention 与 Vector Databases 的 podcast 节目。
「Infra」频道最新
- 瑞银上调英伟达 2027 年 GPU 出货预期 60 万块至 880 万,Rubin 放量驱动 — Beth_Kindig · 2026-10-05
- 特斯拉为每辆车自研推理芯片迭代扩产,算力短缺只是开始 — yunta_tsai · 2026-10-05
- 旧 GPU 正在变成升值资产,a16z 用真实租赁数据量化折旧 — ns123abc · 2026-10-05
- 用 GLM 5.3 Flash 跑双 DGX Spark,全本地搭出跑酷小游戏 — -dysangel- · 2026-10-05
- 穷人 Vulkan 显卡清单:MI50 16GB 二手仅 150 美元成首选 — tabletuser_blogspot · 2026-10-05
- Uber 开源实践:800 个 MCP server、5000+ tools 的企业级 MCP Gateway — Roger_M_Taylor · 2026-10-05